Post di annuncio pubblicato il 14 agosto 2026 sul blog di Z.ai (già Zhipu AI), non firmato, per il lancio di GLM-5.3.

La tesi metodologica. « Scaling post-training is all we did for GLM-5.3. » Stesso modello di base di GLM-5.2: tutto il guadagno viene dal post-training, costruito sullo stack del ciclo precedente — IndexShare (contesto lungo), SAO (RL a lungo orizzonte) e slime (addestramento asincrono, Megatron + SGLang). Il collo di bottiglia si è spostato dal modello all'ambiente: Z.ai descrive pipeline che sintetizzano ambienti e segnale di ricompensa — un agente giudice verifica la risolvibilità, i verificatori sono sintetizzati senza accesso alla soluzione di riferimento, e sono ammessi solo dopo un tris di controlli oracle / no-op / unsolved-state. Il lavoro resta « human-in-the-loop ». Il throughput RL end-to-end è migliorato di oltre 2,3×.

As part of post-training, we introduced vulnerability discovery data and environments into the training mix. We expected this to make the model better at finding and reasoning about vulnerabilities

**Z.ai** , z.ai

I risultati sul coding. Terminal-Bench 3.0 passa da 4,6 a 28,3, DeepSWE v1.1 da 46,2 a 66,9, Agents' Last Exam da 23,8 a 28,5. Sullo Z.ai Code Bench, un benchmark interno e privato, +50% rispetto a GLM-5.2, con un guadagno simultaneo in efficienza dei token: 34,5% a ~75K token di output a effort Max (contro 23,4% a 96K per GLM-5.2), e 31,4% a ~50K a effort High — davanti a Claude Opus 4.8 (29,5% a 120K). Claude Fable 5 resta davanti al 39,5%. L'affermazione « most capable open-weights model for coding » non discende dalla tabella: contro Kimi K3, il punteggio è di 3–3 con un pareggio.

La capacità cyber. Presentata come « emergente », è stata addestrata deliberatamente — il post scrive « we expected this to make the model better ». Ciò che è arrivato come sorpresa è stata la velocità, e il passaggio da falle isolate alla catena di exploitation completa. CyberGym 84,5% (il migliore in tabella), ExploitBench 54,4% (×2,2), ExploitGym 105/130 task (×3,6 rispetto a GLM-5.2, budget normalizzati per throughput). Frase chiave: « Capability is growing fastest exactly where we are furthest behind. »

Il numero più pesante. Lavorando con team di sicurezza cinesi, il modello ha identificato 2.436 vulnerabilità in 269 progetti open source — kernel, sistemi operativi, motori browser, protocolli di rete — la più vecchia introdotta nel 1981, durata media 26,6 anni. Il Security Disclosure Ledger mostra 53 divulgate e 2.383 sotto embargo: 2,2% pubblicate.

Governance. Rilascio dei pesi annunciato « in two weeks, once safety evaluation and hardening are complete »una data, non un criterio: nessuna definizione di hardening, nessuna condizione di non rilascio, nessun valutatore terzo.

Varie. thinking.type: "disabled" non è più supportato (migrazione richiesta); quote del GLM Coding Plan in punti, 50% fuori dalla fascia 14:00–18:00 UTC+8; quasi tutte le valutazioni sono condotte in Claude Code 2.1.207.