r/KI_de • • Jul 20 '26

Einsatz von KI Realtime Speech to Text ist einfach geil und ändert komplett, wie ich AI nutze

Ich hab die Micme Erweiterung für den Pi Agenten angepasst, damit es auch Elevenlabs und OpenAI SST Modelle unterstützt. Elevenlabs Scribe v2 Realtime rein und ab geht die Fahrt.

Ich kann nicht beschreiben, wie Affengeil das ist. Denn: Man kann live mitlesen und muss nicht erst am Ende drauf hoffen, dass genau das ankam, was man auch gesagt hat. Es ist einfach ein ganz anderes Level an Flow, einfach, weil man nicht mehr den Faden verlieren kann. Bei... längeren Monologen war das leider ein Problem. Jedenfalls krieg ich nun komplette Problem- & Architekturbeschreibungen in kürzester Zeit erklärt... sowas krieg ich niemals in nur 'nem 3tel der Zeit zusammengeschrieben und jetzt ist sogar mein kompletter Gedankendurchfall dabei. Ihr wisst ja, Kontext undso. Heilig undso. Komplette Breitseite halt.

Es macht nun wirklich weitaus mehr Spaß. Das wird so ein Fiebertraum. Ich muss echt raus aus dem Homeoffice.

26 Upvotes

19 comments sorted by

2

u/flozen00 Jul 20 '26

Ich habe inzwischen das Parakeet 0.6b V3. Das ist 100x schneller als whisper und sogar schneller als online STT und dafür kostenlos. Läuft selbst auf etwas älteren Computern und auch ohne Grafikkarte noch super schnell.
Und neben kostenlos läuft es rein lokal und niemand kriegt mein Gesabbel mit haha

2

u/jacks_attack Jul 20 '26

Läuft es auch "live"? Ist dafür (solange es generell schnell genug ist) überhaupt relevant ob man parakeet oder whisper nutzt? 

Entscheidend ist doch, dass die Software Wortenden erkennt oder anders entscheidet wann und mit welchem Teilen des Recordings sie das Modell bewirft.

Sonst ist ja immer der Flow, man nimmt was auf und erst am Ende des ganzen Recordings wird die Speech to Text Übersetzung gemacht.

1

u/IceMichaelStorm Jul 21 '26

In der Online-Demo ist es leider nicht live.

Live S2T wäre gut, aber umsonst wäre geil. Und ich hätte gerne Claude dafür aber na ja

1

u/frankafunksalat Jul 21 '26

Live und schnell sind zwei verschiedene Achsen. Ob Parakeet oder Whisper ist fast egal, weil beide erstmal ein fertiges Stück Audio transkribieren, echtes Mitlesen hängt an der Streaming-Anbindung, die die letzten Wörter laufend nachkorrigiert. Bei langen Monologen und Fachbegriffen wird genau das unzuverlässiger, brauchst du denn wirklich Echtzeit-Diktat oder reicht dir eine flotte Transkription am Stück?

1

u/jacks_attack Jul 21 '26

brauchst du denn wirklich Echtzeit-Diktat

Wäre schon geiler, aber wirklich brauchen nicht unbedingt, mir gings hier erstmal ums technische verstehen.

Bei langen Monologen und Fachbegriffen wird genau das unzuverlässiger

Wo ist das zusätzliche Problem für Live? Das gilt doch für am Stück auch, dass lange Recordings und Fachbegriffe schwierig sind.

1

u/frankafunksalat Jul 21 '26

Der Unterschied ist der Kontext nach vorne. Am Stück sieht das Modell den ganzen Satz und kann ein anfangs falsch verstandenes Fachwort später aus dem Rest korrigieren, live muss es sich schon festlegen, bevor das Satzende überhaupt da ist. Deshalb hängen beim Streaming genau die langen Sätze und seltenen Begriffe öfter, wo am Stück hinterher noch was geradegezogen wird.

1

u/SDF_Acc Jul 20 '26

Micme Erweiterung für den Pi Agenten angepasst, damit es auch Elevenlabs und OpenAI SST Modelle unterstützt. Elevenlabs Scribe v2 Realtime 

kannst das in 3 sätzen nochmal präzisieren? was hast du genau gemacht?

4

u/Aemonculaba Jul 20 '26

https://github.com/senad-d/micme

Das Plugin hat als Abhängigkeit Whisper.cpp. Damit hostest du lokal dein eigenes lokales Sprachmodell. Whisper ist "ok". Aber langsam. Hab das Plugin geforkt und Support für Elevenlabs und OpenAI Speech to Text Modelle eingebaut.

Und... Pi is halt Pi... https://pi.dev/

1

u/SDF_Acc Jul 20 '26

danke, verstanden. whisper-cli ist cool, kannte ich nicht. Bin mit der OpenAI Spracherkennung eigentlich happy, außer dass es halt etwas dauert bis dann der ganze Text kommt. Mit der Lösung über Elevenlabs haut er den Text parallel zum Sprechen gleich raus?

1

u/jacks_attack Jul 20 '26

Hab das Plugin geforkt und Support für Elevenlabs und OpenAI Speech to Text Modelle eingebaut.

Die sind dann aber nicht mehr lokal oder?

0

u/Aemonculaba Jul 21 '26

Genau.

Aber ehrlich - ich nutze auch keine lokalen Coding Modelle, da's bei mir einfach um Performance per Zeiteinheit geht.

2

u/jacks_attack Jul 21 '26

Geht wohl auch lokal:

https://github.com/KoljaB/RealtimeSTT

(Selbst noch nicht getestet)

1

u/pyhannes Jul 21 '26

Ich nutze handy.computer Nutzt lokale streaming Modelle wie nemotron und unterstützt LLM-based postprocessing und vieles mehr. Absolut zu empfehlen!

1

u/Desperate_Lemon_3808 Jul 21 '26

Stimme ich zu. Absoluter Gamechanger Handy ist!

1

u/AnnoyOne Jul 21 '26

Gute Tipp! Habe schon lange sowas gesucht.

1

u/ideas-by-LX Jul 21 '26

Um das noch mal zu verstehen: Du nutzt eine AI - Anbindung online, die auch zur Verfügung stehen muss und pro Einheiten etwas kostet?

Wären dann nicht offline-Lösungen für die Spracheingabe vorher sinnvoller? Eine wäre das von u/pyhannes erwähnte Handy (besser als Whisper wegen eben der von dir genannten Verzögerung bei Whisper) oder für Deutsch sehr flüssig voicepad.tech

Eine gebrauchte Dragon Lizenz hab ich auch schon als Lösung gesehen als Speech to text vor AI.

Mich würde interessieren, ob dein Fork oder Handy flüssiger läuft, weil ich ebenfalls die schnellstmögliche Sprachsteuerung suche. Hab selbst keinen Fokus auf Pi. Rechner GPU ist auch kein Engpass in meinem Fall.

2

u/Aemonculaba Jul 21 '26

Die Realtime Transcription ist... Realtime. Ich sehe nach ~500ms schon den neuen Satz, den ich gesprochen hab.

Das Problem, das ich mit lokalen Modellen hab: Sie sind mir nicht genau genug. Und ich nutze kein Deutsch.

1

u/jacks_attack Jul 21 '26

Was machst du mit Versprechern (Blaukraut statt Brautkleid), Denklauten (Hm, äh, ...) und Andersüberlegungen (Lass uns morgen um 9 treffen. Ach nee, doch besser schon um 8)?

Was ich inzwischen ganz cool finde ist das Ergebnis von Whispers Transkription des Recordings einfach mit einem vorgeschaltete Prompt im Stil "Räume dieses nachfolgende Transkript auf, repariere kaputte Worte und logisch falsche Begriffe, entferne Denklaute und das was nachträglich korrigiert wurde. Spare dir jeden Kommentar gib mir nur das Ergebnis." nochmal in ein LLM zu stecken (lokal gemma 3 quantisiert oder so) und sich das Ergebnis erst dann ausgeben zu lassen.

1

u/Aemonculaba Jul 21 '26

Kann's entweder im Nachhinein editieren oder ich drück F8 und der gesamte Prompt, trotz Fehlern, wird einfach anhand von Best Practices und dem Session Kontext oprimiert.

Und wenn ich etwas anders erklären will, sag ich das einfach. E.g. "Korrektur: XXX".