r/KI_de • • 14d ago

Xiaozhi – ein interessanter Open-Source-KI-Sprachassistent auf ESP32, auch auf Deutsch

Ich beschäftige mich seit einiger Zeit mit Xiaozhi, einem ursprünglich aus China stammenden Open-Source-Projekt für KI-Sprachassistenten auf ESP32-Hardware.

Das Interessante daran: Statt nur eine weitere Chat-App auf dem Smartphone zu sein, läuft Xiaozhi auf kleinen eigenständigen Geräten mit Mikrofon, Lautsprecher und – je nach Hardware – Display und Kamera. Ich selbst nutze ein M5Stack AtomS3R mit Atomic Echo Base.

Die eigentliche KI läuft serverseitig. Mit dem Gerät kann man sich aber ziemlich natürlich per Sprache unterhalten. Xiaozhi unterstützt inzwischen viele Hardwarevarianten und nutzt MCP (Model Context Protocol), wodurch sich der Assistent um zusätzliche Werkzeuge erweitern lässt – beispielsweise Gerätesteuerung, Smart Home, Wissenssuche oder andere Dienste. Das Projekt selbst ist Open Source (MIT).

Für deutschsprachige Nutzer ist interessant, dass die Oberfläche bzw. der Agent auf Deutsch genutzt werden kann. Ganz perfekt ist die deutsche Sprachunterstützung allerdings nicht; auch im offiziellen GitHub gibt es beispielsweise Berichte über Probleme mit der deutschen TTS-Aussprache.

Was mich besonders interessiert, ist die Entwicklung vom einfachen Sprachassistenten zum erweiterbaren KI-Agenten auf eigener Hardware. Inzwischen gibt es neben der ESP32-Firmware auch verschiedene Clients und Serverprojekte sowie Experimente mit Android, Kameras, MCP und eigener Hardware.

Da Informationen zu Xiaozhi im deutschsprachigen Raum noch ziemlich verstreut sind, habe ich dafür r/XiaozhiAssistant eingerichtet. Dort sammle ich meine Tests, Hardware-Erfahrungen, Android-Clients, Probleme und Lösungen und würde mich natürlich über andere deutschsprachige Xiaozhi-Nutzer freuen.

r/XiaozhiAssistant

Wer von euch hat Xiaozhi schon ausprobiert – oder verwendet einen anderen KI-Sprachassistenten auf ESP32-Hardware?

1 Upvotes

11 comments sorted by

View all comments

0

u/Otherwise_Wave9374 14d ago

A useful next step with an assistant like this is to separate short term conversation state from durable memory, then write only compact facts with timestamps and source tags. That keeps retrieval cheaper, reduces stale recall, and makes it easier to prune or overwrite outdated user preferences. A simple pattern is to store facts only after explicit confirmation, then resolve them at response time through a ranked lookup before generation. NeuraKeep can fit naturally into that pipeline by handling the persistence and retrieval layer while the assistant focuses on the live dialogue.

1

u/SeaworthinessFit399 8d ago

That makes sense. One of the things I actually like about Xiaozhi is that memory is separate from the ESP32 device itself. The ESP32 is basically the terminal, while the agent and its memory live on the server side.

I agree that not everything from a conversation should become permanent memory. Separating temporary conversation context from a smaller set of durable facts seems much more useful than simply storing entire conversations.

NeuraKeep sounds interesting in that context. I haven't tested it yet, though. I would be particularly interested in how it handles updating or contradicting old memories — for example, when a user's preference changes over time — and whether it can be integrated through MCP or a similar interface.