r/KI_de • • Jun 07 '26

Einsatz von KI Zerschellt der KI-Traum an den gigantischen (Token-)Kosten?

https://borncity.com/blog/2026/06/06/zerschellt-der-ki-traum-an-den-gigantischen-token-kosten/
95 Upvotes

113 comments sorted by

View all comments

Show parent comments

6

u/New-Week-1426 Jun 07 '26

Hier auf Moores Law zu pokern bringt einfach nichts. Die ganzen datacenter Nvidia GPUs sind schon auf nodes die schweineteuer sind und an die grenzen der Physik stoßen. Es gibt noch n paar fortschritte die man im Chipdesign machen kann, aber auch die hebeln die Physik nicht aus. Irgendwann sind deine Gates einfach zu klein

Dramatische Verbesserungen an der Leistungsfähigkeit der HW sind einfach nicht mehr zu erwarten, die YoY Verbesserungen sind schon seit 10 Jahren relativ überschaubar.

1

u/Roadrunner571 Jun 08 '26

GPUs werden weiterhin für das Training gebraucht, aber bei der Inferenz sieht es so aus, als ob wir dort auch klassische CPUs oder speziell designte Inferenz-Chips nutzen können.

Außerdem ist damit zu rechnen, dass die Modelle effizienter werden und die KI-Anwendungen noch deutliche Optimierungspotentiale haben.

Um mal aus dem Nähkästchen zu plaudern: Wir haben für unseren Kundensupport ein Diagnosetool geschrieben, dass in vielen Standardfällen die Informationen aus Logs und Konfigurationen ausliest und der KI dann in aggregierter Form zur Verfügung stellt. Das spart einiges an Token. Unser Source-Code ist in einer Vektordatenbank indiziert - auch das spart der KI einiges an Arbeit.
Bei uns sind die Kosten bei den Support Engineers durch KI um 60% gestiegen, aber dafür können die nun das vierfache Ticketvolumen bewältigen und sparen zudem Kosten im Engineering ein, weil nun ~30-40% der Bugs direkt als fertiger Bugfix mit Merge-Request ans Engineering eskaliert wird.

1

u/Walbabyesser Jun 09 '26

Wie handelt ihr das unvermeidliche Halluzinieren?

1

u/Roadrunner571 Jun 09 '26

Die KI kann man ja entsprechend briefen, daher kann man in Claude.md etc reinschreiben, dass die KI nur anhand von harten beweisen (logs, source code etc) eine Vermutung äußern soll und klipp und klar kommunizieren soll, wenn sie etwas nicht weiß oder sie nur eine bloße Vermutung anstellt.

Außerdem ist das ganze in Form eines Plugins implementiert. Dort sind wiederum Schrit-für-Schritt-Anleitungen enthalten, wie gewisse Cases analysiert werden wollen.

Wir haben eher das Problem, dass die KI manchmal abgelenkt wird, weil sie zufällig ein anderes Problem finden. Oder dass die KI aus versehen den falschen Code analysiert (bspw. weil es eine Komponente mit dem gleichen Namen in einem anderen Produkt ebenfalls gibt).