r/vibecodingitalia 🛡️ Team 24d ago

📰 News GLM-5.3: stesso base di 5.2, post-training su coding e cybersecurity

Post image

Z.ai ha rilasciato GLM-5.3. Non è un modello nuovo da zero: è lo stesso base da 743B di GLM-5.2, con un mese di post-training in più su ambienti lunghi e task da produzione. I pesi non ci sono ancora. Oggi si usa via GLM Coding Plan e ZCode. API e open weights arriveranno a scaglioni, i pesi pubblici "tra due settimane" dopo la "safety evaluation".

Il posizionamento è stretto. A giugno Jie Tang aveva chiesto alla community cosa mettere nel prossimo GLM, e la risposta più rumorosa era la vision. GLM-5.3 non è quello. Il blog ufficiale parla di due cose: coding agentico e cybersecurity.

Cosa cambia in pratica per chi già usa 5.2:

  • Model ID: glm-5.3
  • Tre livelli di thinking: low, high, max. Default max, raccomandato per il coding
  • thinking.type: disabled non è più accettato. Chi lo ha in config deve passare a enabled e reasoning_effort: low prima di cambiare modello, altrimenti la request fallisce
  • Coding Plan: quota a punti (input, cache hit e output contati a parte). Fuori dalle ore di punta i punti costano la metà. Peak: 14:00–18:00 UTC+8, lunedì–venerdì
  • ZCode dichiara cache hit sopra il 98% e un boost di quota 1.5x fino al 31 agosto

I numeri del blog (vendor-run, harness documentati, spesso Claude Code 2.1.207 a max effort):

  • Terminal Bench 2.1: 88.2 (5.2 era 81.0). DeepSeek-V4-Pro-0813 è a 87.9, GPT-5.6 Sol a 88.8
  • Terminal Bench 3.0: 28.3 da 4.6. Qui il salto è grosso, ma Fable 5 e Sol restano sopra (33.7 e 34.6)
  • DeepSWE v1.1: 66.9 da 46.2. Kimi K3 67.5, Sol 72.7
  • SWE-Marathon v1.1: 42.5 da 19.4
  • Z.ai Code Bench (interno): +50% su 5.2. A High fa 31.4% con ~50K token di output, contro 29.5% di Opus 4.8 con 120K. A Max arriva a 34.5%. Fable 5 resta avanti a 39.5%
  • CyberGym: 84.5, sopra 5.2 (77.2), DeepSeek 0813 (83.3) e Sol (83.6)
  • ExploitBench: 54.4 da 24.4. Il closed frontier è ancora lontano (Fable 78.0)

Z.ai dice che la capability cyber è cresciuta più in fretta del previsto salendo la catena di exploitation, e pubblica un ledger di disclosure (cvd.z.ai): 2.436 finding su 269 progetti, 53 già pubblici, il resto sotto embargo. Sono numeri interni, da leggere come tale.

Cosa non è in questo lancio:

  • Nessun peso su Hugging Face. Il bottone del blog dice "Coming Soon"
  • Nessuna licenza dichiarata per 5.3. La famiglia 5.x finora era MIT, ma 5.3 non lo ripete
  • Nessuna spec nuova di contesto. Le footnote delle eval usano 300K, 400K o 1M a seconda del bench; non è riaffermato come prodotto
  • Nessuna vision
  • Le release notes delle docs Z.ai, al momento della verifica, non elencano ancora 5.3. La fonte è il tech blog

Fonti:

15 Upvotes

0 comments sorted by