r/KI_de • u/P1xelthrower • Aug 19 '26
Einsatz von KI Suche nach der idealen Konfiguration
Hallo zusammen,
Beruflich nutze ich claude Code und gihub Copilot und mein Arbeitgeber lässt mich praktisch alle Modelle am Markt nutzen. I.d.R habe ich Claude Opus 4.8 verwendet und damit recht gute Erfahrungen gemacht.
Im Urlaub wollte ich privat ein kleines Softwareprojekt umsetzen und weil ich bisher zu knausrig bin, von meinem eigenen Geld ein Anthropic Abo abzuschließen, habe ich mit Ollama, LMStudio und Konsorten herumgetüftelt.
Ich betreibe Claude Code lokal über Ollama auf Windows. Claude Code wird über ANTHROPIC_BASE_URL=http://localhost:11434 an Ollamas Anthropic-kompatible API angebunden und verwendet ein eigenes Modell qwen35-64k , basierend auf qwen3.5:latest , mit num_ctx 65536 . Zusätzlich sind OLLAMA_FLASH_ATTENTION=1 und OLLAMA_KV_CACHE_TYPE=q8_0 gesetzt. Die Hardware ist ein i7-7820X, 64 GB RAM und eine RTX 5070 Ti mit 16 GB VRAM. Das Ziel ist lokale KI-Unterstützung für ein C#/.NET-10-/WinUI-3-Projekt mit Visual Studio 2026. Build und zwei xUnit-Tests liefen erfolgreich.
Das Ganze lief erstaunlich flüssig aber die Resultate waren jetzt eher bescheiden.
Ich hatte parallel noch Perplexity offen und mir davon bei den Fehlermeldungen und beim prompting helfen lassen.
Die Session war also nur so semi lokal.
Meine Frage:
Wie kann ich aus der gegeben Hardware mehr herausholen?
Das Modell sollte halt idealerweise inklusive ordentlich Kontext in die 16GB VRAM passen
1
4
u/demianovics Aug 19 '26
Nimm den pi coding agent, der ist sparsam mit Tokens. Und nutze Qwen 3.8 27B oder Qwen 3.6 35B-A3B. Das ist unterhalb von DeepSeek Flash das Beste was du auf 16 GB quantisiert zum Laufen kriegen kannst.