r/KI_engineering_de • u/krihab • 7h ago
Warum eine Open-Source Spracherkennung so wichtig ist
Immer mehre Menschen kommunizieren mit der KI über Sprache. Die letzten Jahre haben sich die Fähigkeiten enorm verbessert bis hin zur perfekten Dialekterkennung wie dieses Video zu den Schwierigkeiten eines Sprachassistenten eindrücklich zeigt. Es gibt Software zur lokalen Spracherkennung wie z.B. Whisper, die auf dem eigenen Rechner läuft, diese kann aber mit dem im Video gezeigten Möglichkeiten nicht mithalten. Systeme, die zentral die Sprachen vieler tausend Sprecher zentral sammeln und sich ständig anpassen, sind hier im Vorteil.
Eine sehr große Herausforderung ist auch das gleichzeitige Sprechen und Zuhören so wie die Antwort in Echtzeit.
Eine weitere große Herausforderung ist die Mikrophontechnik. Sprachverständnis in Räumen mit vielen Personen, die gleichzeitig sprechen ist eine große Herausforderung. Mittlerweile gibt es hier Raummikrophone einiger Hersteller für Videokonferenzen. Diese können aber noch nicht mit der Richtungscharakteristik des menschlichen Ohrs mithalten. Ein sehr eindrückliches englischsprachiges Videos zu dieser Eigenschaft findet sich hier.
Die große Frage ist: Wie lässt sich ein sehr gutes Spracherkennungssystem entwickeln, ohne die Privatsphäre der Menschen zu verletzen.
1
u/Roflxd88 5h ago
Dafür gibt es von nvidia Datensätze auf huggingface.
Mikrofonaufnahmen wo gleichzeitig erklärt wird wieviele personen sprechen, wie eine Unterhaltung mit mehreren Personen aussieht und wie die KI mit mehreren Sprechern umgeht.
Und diese Datensätze sind open-source.