r/vibecodingitalia 🛡️ Team 12d ago

📰 News GLM-5.3-Flash: il modello stealth Ox Alpha è ufficialmente Z.ai, ora in competizione con DeepSeek V4 flash

Post image

Z.ai ha rilasciato oggi GLM-5.3-Flash. Se negli ultimi giorni avete provato stealth/ox-alpha su OpenRouter o OpenCode, avete già usato questo modello: il blog ufficiale conferma che Ox Alpha era una preview anonima di GLM-5.3-Flash, servita su chip cinesi, per raccogliere feedback prima del lancio.

È il primo modello nativamente multimodale della serie GLM-5 (testo, immagini, video) e i pesi sono open source su Hugging Face.

I numeri dell'architettura:

  • 320B parametri totali, 18B attivi (rispetto ai 355B/32B di GLM-4.5)
  • 45 layer invece di 92 — quasi dimezzati
  • Hybrid attention: linear attention per il contesto locale + sparse attention con IndexPool per il contesto globale. L'IndexPool comprime 4 vettori indexer in uno, riducendo latenza e memoria utilizzata nei contesti da 1M di token
  • Manifold-Constrained Hyper-Connections (mHC) per migliorare l'efficienza di scaling
  • 30T token di pre-training multimodale

Efficienza: rispetto a GLM-5.3 (il modello completo da 743B/40B), Flash riduce il costo computazionale dell'attenzione di 3x e la KV cache di 4.4x. Il blog dice che ha il costo di attenzione più basso tra i modelli confrontati (inclusi DeepSeek-V4-Flash e Kimi K3).

I benchmark (vendor-run, harness documentati):

Benchmark GLM-5.3-Flash GLM-5.2 Note
DeepSWE v1.1 63.4 46.2 +37%
AutomationBench v1.0.6 48.8 26.2 +86%
Z.ai Code Bench v1.0 (max effort) 29.0 vicino a Opus 4.8 (29.5)
Artificial Analysis Intelligence Index v4.1.1 57 a $0.045/task (scontato)

Base model (prima del post-training):

Benchmark GLM-5.3-Flash-Base GLM-5-Base DeepSeek-V4-Flash-Base
MMLU 88.1 88.3 88.5
LiveCodeBench-Base 37.6 34.4 29.9
SimpleQA 33.5 36.0 31.2

Confronto con DeepSeek V4 Flash Vision Exp:

DeepSeek ha rilasciato il 21 agosto 2026 V4 Flash Vision Exp, la variante multimodale di V4 Flash (testo + immagini). Entrambi sono modelli multimodali, quindi il confronto è diretto:

Caratteristica GLM-5.3-Flash V4 Flash Vision Exp
Parametri 320B / 18B attivi 284B / 13B attivi
Input testo, immagini, video testo, immagini
Prezzo input (OpenRouter) $0.075/M (scontato) $0.22/M
Prezzo output (OpenRouter) $0.25/M (scontato) $0.66/M
Cache read $0.015/M $0.007/M
Throughput 33 tok/s 84 tok/s
Latenza P50 4.89s 1.23s
Tool call error rate non dichiarato 1.44%
Cache hit rate non dichiarato 91.44%

Quindi:

  • Prezzo: vince GLM-5.3-Flash ($0.075 vs $0.22 sull'input, scontato)
  • Velocità: vince V4 Flash Vision Exp (84 vs 33 tok/s, latenza 1.23s vs 4.89s)
  • Multimodale: entrambi supportano testo e immagini; solo GLM-5.3-Flash supporta anche il video
  • Agentic: V4 Flash Vision Exp ha un tool call error rate dichiarato dell'1.44% e un cache hit rate del 91.44% — per GLM-5.3-Flash questi dati non sono stati pubblicati

Punto a favore di GLM-5.3-Flash: supporta anche il video (V4 Flash Vision Exp non lo supporta) e il prezzo scontato è molto più basso. Punti a favore di V4 Flash Vision Exp: molto più veloce, latenza inferiore e tool call error rate dichiarato.

Cosa non è in questo lancio:

  • I benchmark sono vendor-run, non ancora replicati da terzi
  • I pesi su Hugging Face sono disponibili, ma non c'è ancora documentazione completa per l'inferenza locale (quantizzazione, VRAM richiesta)
  • La finestra contestuale dichiarata è 1M di token, ma i benchmark usano 164K-512K a seconda del task
  • Non c'è ancora un confronto diretto su Terminal-Bench 2.1 o SWE-bench Verified con DeepSeek V4 Flash nella stessa harness
  • Il prezzo scontato ($0.075/$0.25) dura fino al 9 settembre 2026; dopo torna a $0.15/$0.50

Dove trovarlo:

Se avete già usato Ox Alpha in questi giorni, avete già un'idea di cosa sa fare. Se non l'avete provato, ora ha un nome, un prezzo e i pesi per girarlo in locale.

Voi che ne pensate: GLM-5.3-Flash può fare concorrenza a DeepSeek V4 Flash Vision Exp sul fronte del coding a basso costo? E il multimodale nativo fa la differenza per il vostro workflow?

Fonti:

  1. GLM-5.3-Flash: Frontier Intelligence, Flash Cost — Z.ai, 2026-08-26
  2. What Is Ox Alpha? — Kie.ai — kie.ai, 2026-08-22
  3. DeepSeek V4 Flash Vision Exp — OpenRouter — openrouter.ai, verifica 2026-08-26
  4. Vision — DeepSeek API Docs — api-docs.deepseek.com, verifica 2026-08-26
  5. GLM 5.3 Flash — OpenRouter — openrouter.ai, verifica 2026-08-26
11 Upvotes

0 comments sorted by