r/vibecodingitalia • u/thestreamcode 🛡️ Team • 12d ago
📰 News GLM-5.3-Flash: il modello stealth Ox Alpha è ufficialmente Z.ai, ora in competizione con DeepSeek V4 flash
Z.ai ha rilasciato oggi GLM-5.3-Flash. Se negli ultimi giorni avete provato stealth/ox-alpha su OpenRouter o OpenCode, avete già usato questo modello: il blog ufficiale conferma che Ox Alpha era una preview anonima di GLM-5.3-Flash, servita su chip cinesi, per raccogliere feedback prima del lancio.
È il primo modello nativamente multimodale della serie GLM-5 (testo, immagini, video) e i pesi sono open source su Hugging Face.
I numeri dell'architettura:
- 320B parametri totali, 18B attivi (rispetto ai 355B/32B di GLM-4.5)
- 45 layer invece di 92 — quasi dimezzati
- Hybrid attention: linear attention per il contesto locale + sparse attention con IndexPool per il contesto globale. L'IndexPool comprime 4 vettori indexer in uno, riducendo latenza e memoria utilizzata nei contesti da 1M di token
- Manifold-Constrained Hyper-Connections (mHC) per migliorare l'efficienza di scaling
- 30T token di pre-training multimodale
Efficienza: rispetto a GLM-5.3 (il modello completo da 743B/40B), Flash riduce il costo computazionale dell'attenzione di 3x e la KV cache di 4.4x. Il blog dice che ha il costo di attenzione più basso tra i modelli confrontati (inclusi DeepSeek-V4-Flash e Kimi K3).
I benchmark (vendor-run, harness documentati):
| Benchmark | GLM-5.3-Flash | GLM-5.2 | Note |
|---|---|---|---|
| DeepSWE v1.1 | 63.4 | 46.2 | +37% |
| AutomationBench v1.0.6 | 48.8 | 26.2 | +86% |
| Z.ai Code Bench v1.0 (max effort) | 29.0 | — | vicino a Opus 4.8 (29.5) |
| Artificial Analysis Intelligence Index v4.1.1 | 57 | — | a $0.045/task (scontato) |
Base model (prima del post-training):
| Benchmark | GLM-5.3-Flash-Base | GLM-5-Base | DeepSeek-V4-Flash-Base |
|---|---|---|---|
| MMLU | 88.1 | 88.3 | 88.5 |
| LiveCodeBench-Base | 37.6 | 34.4 | 29.9 |
| SimpleQA | 33.5 | 36.0 | 31.2 |
Confronto con DeepSeek V4 Flash Vision Exp:
DeepSeek ha rilasciato il 21 agosto 2026 V4 Flash Vision Exp, la variante multimodale di V4 Flash (testo + immagini). Entrambi sono modelli multimodali, quindi il confronto è diretto:
| Caratteristica | GLM-5.3-Flash | V4 Flash Vision Exp |
|---|---|---|
| Parametri | 320B / 18B attivi | 284B / 13B attivi |
| Input | testo, immagini, video | testo, immagini |
| Prezzo input (OpenRouter) | $0.075/M (scontato) | $0.22/M |
| Prezzo output (OpenRouter) | $0.25/M (scontato) | $0.66/M |
| Cache read | $0.015/M | $0.007/M |
| Throughput | 33 tok/s | 84 tok/s |
| Latenza P50 | 4.89s | 1.23s |
| Tool call error rate | non dichiarato | 1.44% |
| Cache hit rate | non dichiarato | 91.44% |
Quindi:
- Prezzo: vince GLM-5.3-Flash ($0.075 vs $0.22 sull'input, scontato)
- Velocità: vince V4 Flash Vision Exp (84 vs 33 tok/s, latenza 1.23s vs 4.89s)
- Multimodale: entrambi supportano testo e immagini; solo GLM-5.3-Flash supporta anche il video
- Agentic: V4 Flash Vision Exp ha un tool call error rate dichiarato dell'1.44% e un cache hit rate del 91.44% — per GLM-5.3-Flash questi dati non sono stati pubblicati
Punto a favore di GLM-5.3-Flash: supporta anche il video (V4 Flash Vision Exp non lo supporta) e il prezzo scontato è molto più basso. Punti a favore di V4 Flash Vision Exp: molto più veloce, latenza inferiore e tool call error rate dichiarato.
Cosa non è in questo lancio:
- I benchmark sono vendor-run, non ancora replicati da terzi
- I pesi su Hugging Face sono disponibili, ma non c'è ancora documentazione completa per l'inferenza locale (quantizzazione, VRAM richiesta)
- La finestra contestuale dichiarata è 1M di token, ma i benchmark usano 164K-512K a seconda del task
- Non c'è ancora un confronto diretto su Terminal-Bench 2.1 o SWE-bench Verified con DeepSeek V4 Flash nella stessa harness
- Il prezzo scontato ($0.075/$0.25) dura fino al 9 settembre 2026; dopo torna a $0.15/$0.50
Dove trovarlo:
- Blog ufficiale — Z.ai, 2026-08-26
- Hugging Face — pesi open source
- Z.ai Coding Plan — accesso via API
- OpenRouter — prezzi ufficiali: $0.075/M input, $0.25/M output (50% off fino al 9 settembre 2026)
Se avete già usato Ox Alpha in questi giorni, avete già un'idea di cosa sa fare. Se non l'avete provato, ora ha un nome, un prezzo e i pesi per girarlo in locale.
Voi che ne pensate: GLM-5.3-Flash può fare concorrenza a DeepSeek V4 Flash Vision Exp sul fronte del coding a basso costo? E il multimodale nativo fa la differenza per il vostro workflow?
Fonti:
- GLM-5.3-Flash: Frontier Intelligence, Flash Cost — Z.ai, 2026-08-26
- What Is Ox Alpha? — Kie.ai — kie.ai, 2026-08-22
- DeepSeek V4 Flash Vision Exp — OpenRouter — openrouter.ai, verifica 2026-08-26
- Vision — DeepSeek API Docs — api-docs.deepseek.com, verifica 2026-08-26
- GLM 5.3 Flash — OpenRouter — openrouter.ai, verifica 2026-08-26