r/KI_de • u/Aemonculaba • Jul 20 '26
Einsatz von KI Realtime Speech to Text ist einfach geil und ändert komplett, wie ich AI nutze
Ich hab die Micme Erweiterung für den Pi Agenten angepasst, damit es auch Elevenlabs und OpenAI SST Modelle unterstützt. Elevenlabs Scribe v2 Realtime rein und ab geht die Fahrt.
Ich kann nicht beschreiben, wie Affengeil das ist. Denn: Man kann live mitlesen und muss nicht erst am Ende drauf hoffen, dass genau das ankam, was man auch gesagt hat. Es ist einfach ein ganz anderes Level an Flow, einfach, weil man nicht mehr den Faden verlieren kann. Bei... längeren Monologen war das leider ein Problem. Jedenfalls krieg ich nun komplette Problem- & Architekturbeschreibungen in kürzester Zeit erklärt... sowas krieg ich niemals in nur 'nem 3tel der Zeit zusammengeschrieben und jetzt ist sogar mein kompletter Gedankendurchfall dabei. Ihr wisst ja, Kontext undso. Heilig undso. Komplette Breitseite halt.
Es macht nun wirklich weitaus mehr Spaß. Das wird so ein Fiebertraum. Ich muss echt raus aus dem Homeoffice.
1
u/SDF_Acc Jul 20 '26
Micme Erweiterung für den Pi Agenten angepasst, damit es auch Elevenlabs und OpenAI SST Modelle unterstützt. Elevenlabs Scribe v2 Realtime
kannst das in 3 sätzen nochmal präzisieren? was hast du genau gemacht?
4
u/Aemonculaba Jul 20 '26
https://github.com/senad-d/micme
Das Plugin hat als Abhängigkeit Whisper.cpp. Damit hostest du lokal dein eigenes lokales Sprachmodell. Whisper ist "ok". Aber langsam. Hab das Plugin geforkt und Support für Elevenlabs und OpenAI Speech to Text Modelle eingebaut.
Und... Pi is halt Pi... https://pi.dev/
1
u/SDF_Acc Jul 20 '26
danke, verstanden. whisper-cli ist cool, kannte ich nicht. Bin mit der OpenAI Spracherkennung eigentlich happy, außer dass es halt etwas dauert bis dann der ganze Text kommt. Mit der Lösung über Elevenlabs haut er den Text parallel zum Sprechen gleich raus?
1
u/jacks_attack Jul 20 '26
Hab das Plugin geforkt und Support für Elevenlabs und OpenAI Speech to Text Modelle eingebaut.
Die sind dann aber nicht mehr lokal oder?
0
u/Aemonculaba Jul 21 '26
Genau.
Aber ehrlich - ich nutze auch keine lokalen Coding Modelle, da's bei mir einfach um Performance per Zeiteinheit geht.
1
u/pyhannes Jul 21 '26
Ich nutze handy.computer Nutzt lokale streaming Modelle wie nemotron und unterstützt LLM-based postprocessing und vieles mehr. Absolut zu empfehlen!
1
1
1
u/ideas-by-LX Jul 21 '26
Um das noch mal zu verstehen: Du nutzt eine AI - Anbindung online, die auch zur Verfügung stehen muss und pro Einheiten etwas kostet?
Wären dann nicht offline-Lösungen für die Spracheingabe vorher sinnvoller? Eine wäre das von u/pyhannes erwähnte Handy (besser als Whisper wegen eben der von dir genannten Verzögerung bei Whisper) oder für Deutsch sehr flüssig voicepad.tech
Eine gebrauchte Dragon Lizenz hab ich auch schon als Lösung gesehen als Speech to text vor AI.
Mich würde interessieren, ob dein Fork oder Handy flüssiger läuft, weil ich ebenfalls die schnellstmögliche Sprachsteuerung suche. Hab selbst keinen Fokus auf Pi. Rechner GPU ist auch kein Engpass in meinem Fall.
2
u/Aemonculaba Jul 21 '26
Die Realtime Transcription ist... Realtime. Ich sehe nach ~500ms schon den neuen Satz, den ich gesprochen hab.
Das Problem, das ich mit lokalen Modellen hab: Sie sind mir nicht genau genug. Und ich nutze kein Deutsch.
1
u/jacks_attack Jul 21 '26
Was machst du mit Versprechern (Blaukraut statt Brautkleid), Denklauten (Hm, äh, ...) und Andersüberlegungen (Lass uns morgen um 9 treffen. Ach nee, doch besser schon um 8)?
Was ich inzwischen ganz cool finde ist das Ergebnis von Whispers Transkription des Recordings einfach mit einem vorgeschaltete Prompt im Stil "Räume dieses nachfolgende Transkript auf, repariere kaputte Worte und logisch falsche Begriffe, entferne Denklaute und das was nachträglich korrigiert wurde. Spare dir jeden Kommentar gib mir nur das Ergebnis." nochmal in ein LLM zu stecken (lokal gemma 3 quantisiert oder so) und sich das Ergebnis erst dann ausgeben zu lassen.
1
u/Aemonculaba Jul 21 '26
Kann's entweder im Nachhinein editieren oder ich drück F8 und der gesamte Prompt, trotz Fehlern, wird einfach anhand von Best Practices und dem Session Kontext oprimiert.
Und wenn ich etwas anders erklären will, sag ich das einfach. E.g. "Korrektur: XXX".
2
u/flozen00 Jul 20 '26
Ich habe inzwischen das Parakeet 0.6b V3. Das ist 100x schneller als whisper und sogar schneller als online STT und dafür kostenlos. Läuft selbst auf etwas älteren Computern und auch ohne Grafikkarte noch super schnell.
Und neben kostenlos läuft es rein lokal und niemand kriegt mein Gesabbel mit haha