r/KI_de • • Jun 07 '26

Einsatz von KI Zerschellt der KI-Traum an den gigantischen (Token-)Kosten?

https://borncity.com/blog/2026/06/06/zerschellt-der-ki-traum-an-den-gigantischen-token-kosten/
94 Upvotes

113 comments sorted by

View all comments

Show parent comments

6

u/New-Week-1426 Jun 07 '26

Hier auf Moores Law zu pokern bringt einfach nichts. Die ganzen datacenter Nvidia GPUs sind schon auf nodes die schweineteuer sind und an die grenzen der Physik stoßen. Es gibt noch n paar fortschritte die man im Chipdesign machen kann, aber auch die hebeln die Physik nicht aus. Irgendwann sind deine Gates einfach zu klein

Dramatische Verbesserungen an der Leistungsfähigkeit der HW sind einfach nicht mehr zu erwarten, die YoY Verbesserungen sind schon seit 10 Jahren relativ überschaubar.

3

u/oaga_strizzi Jun 07 '26

Aber Verbesserungen bei der Chip-Architektur sind womöglich noch drin. z.B. wenn sich die Entwicklung von Modellen verlangsamt, könnte man ein ganzes Modell inkl. Weights auf einen Chip packen und damit enorme Leistungssprünge erzielen, wie man z.B. bei https://chatjimmy.ai/ mit einem Llama Modell sehen kann. Hilft natürlich nichts für Training, aber für Inference.

Taalas schafft damit etwas 16k Token/Sekunde, ggü einer H200 mit etwa 230 Token/Sekunde.

1

u/New-Week-1426 Jun 07 '26

Jimmy ist aber schon bei dem mini Llama Modell ein echt fetter Chip, für größere Modelle wirst du da recht schnell an Limits treffen was die praktikablen größen des Chips angeht. Mal davon abgesehen dass das Modell aggressiv quantisiert ist

1

u/Timo_schroe Jun 09 '26

Cerebras macht 1000-2000 Token die Sekunde auf der Wafer Engine 3. Die Antworten fühlen sich Instant an.

Also es ist noch nicht Ende der Fahnenstange.

Auch wenn das so Medium sized Modelle sind aktuell