# zai-glm-53-emergent-cyber-2026-08-14

## Veille

Post di annuncio pubblicato sul **blog ufficiale di Z.ai** (già Zhipu AI, laboratorio cinese) il **14 agosto 2026**, **senza firma individuale**, ~2.000 parole più note a piè di pagina. Annuncia **GLM-5.3**, successore di GLM-5.2, aprendo con una tesi metodologica: *« Scaling post-training is all we did for GLM-5.3. »* Stesso modello di base di GLM-5.2 — *« every gain comes from post-training »*. Tre annunci. **(A) Un modello di coding open-weights**: +50% dichiarato sul **Z.ai Code Bench**, un benchmark interno non pubblicato. **(B) Una capacità cyber presentata come "emergente"**, che il corpo del testo riconduce a una scelta di addestramento — *« As part of post-training, we introduced vulnerability discovery data and environments into the training mix. We expected this to make the model better at finding and reasoning about vulnerabilities »* — ciò che è arrivato come sorpresa è la velocità e il cambiamento di natura: il modello passa dall'identificazione di falle isolate a *« coherent plans for complete exploitation chains »*. I guadagni crescono con la posizione nella catena di exploitation: CyberGym 77,2 → **84,5%**, ExploitBench 24,4 → **54,4%** (×2,2), ExploitGym 29 → **105** task in 2h (×3,6), con il divario rispetto alla frontiera chiusa che resta ampio (181 e 247 task). Z.ai lo formula così: *« Capability is growing fastest exactly where we are furthest behind. »* Il post pubblica anche un **Z.ai Security Disclosure Ledger**: **2.436 vulnerabilità identificate in 269 progetti open source** — kernel, sistemi operativi, motori browser, infrastrutture, applicazioni web, protocolli di rete — la più vecchia introdotta nel **1981**, durata media prima della scoperta **26,6 anni**, di cui **53 divulgate** e **2.383 sotto embargo**. **(C) Un rilascio dei pesi** *« within two weeks of launch, once safety evaluation and hardening are complete »*. Il contributo metodologico più riutilizzabile: **sintesi di ambiente e verificatore**, quest'ultimo prodotto senza accesso alla soluzione di riferimento e ammesso solo dopo un tris di controlli negativi — **oracle**, **no-op**, **unsolved-state**. Tutte le valutazioni agentiche sono condotte **in Claude Code 2.1.207**.

## Titre Article

GLM-5.3: Frontier Coding with Emergent Cyber Capabilities

## Date

2026-08-14

## URL

https://z.ai/blog/glm-5.3

## Keywords

GLM-5.3, GLM-5.2, Z.ai, Zhipu AI, open weights, open-weights, laboratorio cinese, post-training, post-training scaling, RL scaling, sintesi di ambiente, task a lungo orizzonte, SAO, IndexShare, slime, Megatron, SGLang, multi-teacher OPD, verificatore sintetico, sintesi del verificatore, ricompensa binaria, reward hacking, controllo oracle, controllo no-op, controllo unsolved-state, agente giudice, human-in-the-loop, capacità cyber, scoperta di vulnerabilità, catena di exploitation, CyberGym, ExploitBench, ExploitGym, divulgazione coordinata, Security Disclosure Ledger, embargo, 2436 vulnerabilità, 269 progetti, 2383 sotto embargo, 1981, 26, 6 anni, dual-use, rilascio dei pesi, valutazione di sicurezza, hardening, Terminal-Bench 3.0, DeepSWE, SWE-Marathon, PostTrainBench, Agents' Last Exam, GDPval-AA v2, Z.ai Code Bench, benchmark privato, contaminazione del benchmark, efficienza dei token, reasoning_effort, Claude Code 2.1.207, harness di valutazione, Artificial Analysis, Kimi K3, GLM Coding Plan, tariffazione fuori punta, ZCode

## Authors

**Z.ai** (anciennement **Zhipu AI**), laboratoire d'IA chinois, éditeur de la famille **GLM**. Billet **institutionnel et non signé** : aucun auteur nommé, aucun chercheur mis en avant, aucun lien vers un rapport technique ou une carte de modèle. Publié le **14 août 2026**. La page est une SPA React — le HTML servi est un `<div id="root">` vide, et le texte comme les scores ont dû être extraits du bundle `glm-5.3-BCnx8T5_.js`, où ils figurent en valeurs source.

## Ton

**Profilo**: annuncio di prodotto di un laboratorio di modelli, registro di un **rapporto tecnico abbreviato** — denso, quantificato, privo di superlativi di marketing. Pubblico: ingegneri ML, team di piattaforma, acquirenti API. Una nota da ingegneri il cui unico elemento di marketing è il titolo.

**Stile**: l'apertura è una tesi metodologica, non un'affermazione di performance — *« Scaling post-training is all we did for GLM-5.3 »*, prima frase, in grassetto: l'annuncio dice meno "ecco un modello migliore" che "ecco ciò che abbiamo trovato più conveniente fare". L'ammissione di essere in ritardo è lasciata in piena vista, senza attenuazioni: *« Mythos 5 remains well ahead at 181 and 247 tasks »*, poi *« Capability is growing fastest exactly where we are furthest behind. »* Il titolo usa *« emergent »* dove il corpo del testo descrive un'aggiunta deliberata di dati sulla scoperta di vulnerabilità al mix di addestramento; l'unico elemento che il testo definisce inaspettato è il ritmo. La descrizione del metodo è più generosa della media del settore — la catena di sintesi di ambiente e verificatore è esposta passo dopo passo e si chiude con un limite riconosciuto: *« These pipelines still require a meaningful amount of human-in-the-loop work. »* Le note a piè di pagina portano la verità operativa: temperature, finestre di contesto, timeout, avg@3, whitelist anti-cheat e soprattutto le **modifiche apportate agli harness ufficiali** (controlli anti-cheat rimossi su `strip-clone` per falsi positivi, `--extra-index-url` aggiunto su `parameter-golf` e `trimul-cuda` per correggere le build Docker) — una divulgazione rara, che a sua volta rende i punteggi non comparabili alle classifiche ufficiali.

**Frasi marcatore**:
- ***« Scaling post-training is all we did for GLM-5.3 »***
- ***« every gain comes from post-training »***
- ***« much of the difficulty in scaling post-training moves from the model to the environment »***
- ***« a judge agent then attempts each task to verify that it is actually solvable »***
- ***« Verifiers are synthesized without access to the reference solution »***
- ***« it began to reason across multiple stages of exploitation, forming coherent plans for complete exploitation chains »***
- ***« Capability is growing fastest exactly where we are furthest behind »***
- ***« We will release the weights in two weeks after launch, once safety evaluation and hardening are complete »***
- ***« Disabling thinking is no longer supported »***

**Posizione epistemica**: una parte interessata, trasparente sul proprio metodo, che giudica la propria stessa performance. Affidabile sul *come* il modello è stato addestrato e su *in quali condizioni* è stato misurato; non verificabile su *quanto* valga — l'affermazione centrale poggia su un benchmark privato e i punteggi dei concorrenti sono stati prodotti da Z.ai, con tre eccezioni attribuite (GDPval-AA v2 e FrontierSWE ad **Artificial Analysis**, Toolathlon Verified tramite il servizio di valutazione ufficiale).

## Pense-betes

- **Data / fonte**: **14 agosto 2026**, blog ufficiale **Z.ai**, post non firmato. Pagina costruita come SPA React, non catturabile con un semplice `curl | lynx`; il nome del bundle è hashato, quindi instabile.
- **Inquadramento chiave**: stesso modello di base di GLM-5.2, tutti i guadagni derivano dal post-training. Il termine *« emergent »* nel titolo si riferisce, nel corpo del testo, a un **ritmo di progresso** — la capacità in sé essendo stata addestrata deliberatamente. ### La curva cyber: il guadagno cresce con la posizione nella catena | Benchmark | Cosa misura | GLM-5.2 → GLM-5.3 | Fattore | Migliore in tabella | |---|---|---|---|---| | CyberGym | identificare e validare una falla in white-box | 77,2 → **84,5%** | ×1,09 | **GLM-5.3** (davanti a 83,8 / 83,6) | | ExploitBench | ragionare sull'exploitation di falle reali | 24,4 → **54,4%** | **×2,2** | 78,0 (modello chiuso) | | ExploitGym (2h) | task di exploitation completati, budget normalizzato | 29 → **105** | **×3,6** | 181 (modello chiuso) | | ExploitGym (6h) | idem, 6h | 39 → **130** | ×3,3 | 247 (modello chiuso) | Due letture simultanee, entrambe corrette: Z.ai resta molto indietro rispetto alla frontiera chiusa ovunque l'exploitation diventi reale, ed è esattamente lì che il suo progresso è più rapido — per un mese aggiuntivo di post-training sullo stesso modello di base. Trappola di citazione: i budget di ExploitGym sono **normalizzati per throughput**, il tempo API venendo riscalato secondo il TPS di ciascun modello (115 per GLM-5.3, 40 per Kimi K3, 47 per Qwen3.8-Max, fonte Artificial Analysis). Non sono ore reali. ### Il Security Disclosure Ledger | Contatore | Valore | Quota | |---|---|---| | Risultati tracciati | **2.436** | 100% | | Divulgati pubblicamente | **53** | **2,2%** | | Sotto embargo | **2.383** | **97,8%** | | Critical & High | 1.097 | 45% | | Progetti OSS interessati | **269** | — | Un embargo rientra nella divulgazione coordinata ordinaria; ciò che colpisce è la dimensione dell'arretrato e il tasso di pubblicazione. Quattro punti che il post non affronta: la politica dei tempi, l'effettiva notifica ai maintainer dei 269 progetti, l'identità dei *« several security teams in China »* menzionati, e cosa accade all'embargo una volta rilasciati i pesi — un modello pubblico in grado di riscoprire queste falle rende di fatto vano l'embargo. ### Il calendario del rilascio dei pesi *« We will release the weights in two weeks after launch, once safety evaluation and hardening are complete. »* Ciò che non è specificato: la definizione di *hardening* per pesi aperti, i criteri che innescherebbero un ritardo, l'esistenza di un valutatore terzo o red team nominato, e qualsiasi impegno a pubblicare il rapporto. Il calendario è ancorato al lancio commerciale, non al completamento di un processo. Conseguenza pratica: al 14 agosto 2026, GLM-5.3 è un modello API abbinato a un'intenzione di apertura, non integrato in un'architettura di reversibilità prima del rilascio effettivo. Confronto con il trattamento del rilascio dei pesi in [[zuckerberg-meta-future-is-for-everyone-superintelligence-2026-08-10]]. ### L'affermazione "most capable open-weights model for coding" Sui 7 benchmark del gruppo *Coding* in cui **Kimi K3** è riportato nella tabella di Z.ai: | Benchmark | GLM-5.3 | Kimi K3 | Vantaggio | |---|---|---|---| | Terminal Bench 2.1 | 88,2 | **88,3** | Kimi K3 | | Terminal-Bench 3.0 | **28,3** | 17,4 | GLM-5.3 (ampio) | | DeepSWE (v1.1) | 66,9 | **67,5** | Kimi K3 | | NL2Repo | 58 | 58 | pareggio | | ProgramBench | **19** | 17,5 | GLM-5.3 | | SWE-Marathon (v1.1) | 42,5 | **48,1** | Kimi K3 (ampio) | | PostTrainBench | **39,8** | 32 | GLM-5.3 | Cioè **3–3 con un pareggio**. Due affermazioni più circoscritte reggono tuttavia: *« open-source SOTA on Terminal Bench 3.0 »* (28,3 contro 17,4) e su *Agents' Last Exam* (28,5 contro 27,6 per Kimi K3 e 27 per Qwen3.8-Max, entro 0,1 punto dal miglior modello chiuso in tabella). ### Il guadagno di una generazione di post-training | Benchmark | GLM-5.2 | GLM-5.3 | Scarto | |---|---|---|---| | Terminal-Bench 3.0 | 4,6 | **28,3** | **×6,2** | | SWE-Marathon (v1.1) | 19,4 | **42,5** | ×2,2 | | DeepSWE (v1.1) | 46,2 | **66,9** | +20,7 pt | | AutomationBench | 26,2 | **48,2** | +22 pt | | Agents' Last Exam | 23,8 | **28,5** | +4,7 pt | | GDPval-AA v2 | 1508 | **1769** | +261 | Lettura: sui task agentici lunghi, l'ambiente di addestramento si rivela una leva più efficiente in termini di costo rispetto a un nuovo pretraining — *« much of the difficulty in scaling post-training moves from the model to the environment »*. Uno scarto di ×6,2 in un solo mese indica anche che il benchmark era lontano dalla saturazione: Terminal-Bench 3.0 è ancora al 28,3%, cioè più di sette task su dieci falliscono. Contesto sui benchmark agentici: [[patel-block-buzz-teams-tokens-benchmarks-2026-08-06]]. ### Costo per task riuscito (Z.ai Code Bench, privato) | Configurazione | Punteggio | Token di output / task | |---|---|---| | GLM-5.2, effort Max | 23,4% | 96K | | **GLM-5.3, effort Max** | **34,5%** | **~75K** | | GLM-5.3, effort High | 31,4% | ~50K | | Claude Opus 4.8 (misurazione Z.ai) | 29,5% | 120K | | Claude Fable 5, effort Max | **39,5%** | non divulgato | L'argomento di vendita è il rapporto: +5 punti rispetto a Opus 4.8 per circa 1,6× meno token di output. Tre cautele da tenere insieme: benchmark interno e privato, confronto autoarbitrato, e Fable 5 resta comunque davanti — Z.ai stesso lo pubblica. Il costo dei token di output non è nemmeno il costo totale (input, cache, numero di turni). ### La catena di verifica, trasponibile fuori da Z.ai 1. Agenti di ricerca raccolgono pattern di task da lavoro reale e li convertono in ambienti eseguibili, a lungo orizzonte, con dipendenze multi-step e stato nascosto. 2. Un **agente giudice tenta ogni task** per verificare che sia effettivamente risolvibile. 3. **I verificatori sono sintetizzati senza accesso alla soluzione di riferimento** — quindi non possono codificare la risposta. 4. Le traiettorie del solver sono usate per scoprire e chiudere scorciatoie di ricompensa. 5. Un verificatore è ammesso solo se supera **oracle** (accetta la soluzione vera), **no-op** (rifiuta di non fare nulla) e **unsolved-state** (rifiuta lo stato iniziale). Solo allora *« produce a binary reward reliable enough to train on directly »*. I punti 3 e 5 si trasferiscono a qualsiasi generazione automatica di test: un test che non fallisce rosso sul codice originale non prova nulla. Stesso requisito formulato in [[dumortier-marketing-ai-os-verification-2026-08-12]]. Limite riconosciuto da Z.ai: *« These pipelines still require a meaningful amount of human-in-the-loop work. »* ### Claude Code come harness di valutazione Sette valutazioni documentate in nota sono condotte *« in Claude Code 2.1.207 »* — Terminal-Bench 2.1 e 3.0, ALE, CyberGym, ExploitGym, ExploitBench, PostTrainBench, SWE-Marathon. Un laboratorio cinese misura lì il proprio modello di frontiera e quelli dei concorrenti, citando la versione come dipendenza. Corollario non conteggiato: la trasferibilità dei punteggi a un altro harness. ### Rottura API e prezzi
- *« Disabling thinking is no longer supported by GLM-5.3 »*: `thinking.type: "disabled"` provoca il fallimento della richiesta. Migrazione prescritta: passare a `enabled` **e** `reasoning_effort: "low"` **prima** di cambiare l'ID del modello. Tre livelli `low` / `high` / `max`, **default `max`**. Il costo minimo di una chiamata quindi aumenta; per qualsiasi carico ad alto volume e bassa complessità, il passaggio a `low` deve precedere il cambio di ID.
- **GLM Coding Plan** usa quote a punti, contate separatamente per input, input in cache e output. **Ore di punta 14:00–18:00 UTC+8, dal lunedì al venerdì**, tutto il resto al 50% della tariffa — il che significa, per un team europeo, una fascia di punta corrispondente alle 08:00–12:00 ora di Parigi. Offerta ZCode associata: dichiarato *« 98%+ cache hit rate »*, ~30% di token effettivi in più, aumento di quota 1,5× fino al **31 agosto 2026**, modalità *Goal* e *Remote Control* via **WeChat o Feishu**. ### Tre incoerenze interne, da non propagare 1. *« 1,097 medium-to-high severity issues »* contraddice la stessa colonna laterale del post: critical 107 + high 990 = **1.097**, medium 1.286 separato. Citare **"1.097 falle critiche o ad alta gravità"**. 2. *« the oldest dating back roughly 40 years »* contraddice la colonna laterale (*« introduced in 1981 »*, *« 45 YEARS OF IMPACT »*). Usare **1981** e una durata media di **26,6 anni**. 3. Il corpo del testo attribuisce a **"Mythos 5"** i punteggi 83,8 / 78,0 / 181-247 che la tabella attribuisce a **"Fable 5 (w/ fallback)"**. Sono due modelli Anthropic distinti e il post non chiarisce quale sia. Non attribuire questi punteggi a un modello nominato. ### Infrastruttura di addestramento Post-training su **slime** (framework open source di Z.ai), **Megatron** per l'addestramento, **SGLang** per il rollout, con addestramento, rollout e buffer su un unico flusso di dati — gli ambienti si inseriscono come generazione di dati, non come modifiche del loop. Guadagni dichiarati: divario medio di log-probability addestramento/rollout controllato a **1e-7**, **multi-teacher OPD** con switching dinamico e prefetching, scheduling congiunto router/slime, per un totale di **oltre 2,3× throughput end-to-end** sui task RL di coding a lungo orizzonte. Pubblicazioni sottostanti: **IndexShare** (arXiv 2603.12201) e **SAO** (arXiv 2607.07508). ### Igiene delle citazioni
- Tutto ciò che proviene da **Z.ai Code Bench** è verificabile solo per costruzione: citarlo come *« secondo un benchmark interno non pubblicato »*.
- Ogni punteggio dei concorrenti in tabella è stato prodotto da Z.ai, ad eccezione di GDPval-AA v2 e FrontierSWE (Artificial Analysis) e Toolathlon Verified (servizio ufficiale).
- Gli harness pubblici sono stati modificati; i punteggi non sono comparabili alle classifiche ufficiali.
- Il legame con il dossier sulla sovranità è diretto: tre giorni prima, [[nunez-mistral-gigawatt-compute-europeen-venturebeat-2026-08-11]] annunciava che Mistral AI ospita GLM-5.2 sotto controlli regionali europei. Le valutazioni di sicurezza che Mistral dichiara di eseguire su modelli terzi non sono state descritte pubblicamente.

## RésuméDe400mots

Post di annuncio pubblicato il **14 agosto 2026** sul blog di **Z.ai** (già Zhipu AI), **non firmato**, per il lancio di **GLM-5.3**.

**La tesi metodologica.** *« Scaling post-training is all we did for GLM-5.3. »* Stesso modello di base di GLM-5.2: **tutto il guadagno viene dal post-training**, costruito sullo stack del ciclo precedente — **IndexShare** (contesto lungo), **SAO** (RL a lungo orizzonte) e **slime** (addestramento asincrono, Megatron + SGLang). Il collo di bottiglia si è spostato dal modello **all'ambiente**: Z.ai descrive pipeline che **sintetizzano** ambienti e segnale di ricompensa — un agente giudice verifica la risolvibilità, **i verificatori sono sintetizzati senza accesso alla soluzione di riferimento**, e sono ammessi solo dopo un tris di controlli **oracle / no-op / unsolved-state**. Il lavoro resta *« human-in-the-loop »*. Il throughput RL end-to-end è migliorato di **oltre 2,3×**.

**I risultati sul coding.** Terminal-Bench 3.0 passa da **4,6 a 28,3**, DeepSWE v1.1 da **46,2 a 66,9**, Agents' Last Exam da **23,8 a 28,5**. Sullo **Z.ai Code Bench**, un benchmark **interno e privato**, +50% rispetto a GLM-5.2, con un guadagno simultaneo in **efficienza dei token**: 34,5% a ~75K token di output a effort Max (contro 23,4% a 96K per GLM-5.2), e 31,4% a ~50K a effort High — davanti a Claude Opus 4.8 (29,5% a 120K). **Claude Fable 5 resta davanti al 39,5%.** L'affermazione *« most capable open-weights model for coding »* **non discende dalla tabella**: contro **Kimi K3**, il punteggio è di **3–3 con un pareggio**.

**La capacità cyber.** Presentata come *« emergente »*, è stata **addestrata deliberatamente** — il post scrive *« we expected this to make the model better »*. Ciò che è arrivato come sorpresa è stata la **velocità**, e il passaggio da falle isolate alla **catena di exploitation completa**. CyberGym **84,5%** (il migliore in tabella), ExploitBench **54,4%** (×2,2), ExploitGym **105/130 task** (×3,6 rispetto a GLM-5.2, budget normalizzati per throughput). Frase chiave: ***« Capability is growing fastest exactly where we are furthest behind. »***

**Il numero più pesante.** Lavorando con team di sicurezza cinesi, il modello ha identificato **2.436 vulnerabilità in 269 progetti open source** — kernel, sistemi operativi, motori browser, protocolli di rete — la più vecchia introdotta nel **1981**, durata media **26,6 anni**. Il **Security Disclosure Ledger** mostra **53 divulgate** e **2.383 sotto embargo**: **2,2% pubblicate**.

**Governance.** Rilascio dei pesi annunciato *« in two weeks, once safety evaluation and hardening are complete »* — **una data, non un criterio**: nessuna definizione di hardening, nessuna condizione di non rilascio, nessun valutatore terzo.

**Varie.** `thinking.type: "disabled"` **non è più supportato** (migrazione richiesta); quote del GLM Coding Plan in punti, **50% fuori dalla fascia 14:00–18:00 UTC+8**; **quasi tutte le valutazioni sono condotte in Claude Code 2.1.207**.

## GrapheDeConnaissance

- Z.ai —publie→ GLM-5.3 (TECHNOLOGIE, 0.98)
- GLM-5.3 —est_variante_de→ GLM (TECHNOLOGIE, 0.97)
- Z.ai —publie→ GLM (TECHNOLOGIE, 0.98)
- GLM-5.3 —remplace→ GLM-5.2 (TECHNOLOGIE, 0.97)
- GLM-5.3 —est_basé_sur→ GLM-5.2 (TECHNOLOGIE, 0.96)
- Z.ai —affirme_que→ GLM-5.3 utilise le même modèle de base que GLM-5.2 et que la totalité du gain provient du post-entraînement — « Scaling post-training is all we did » (CITATION, 0.97)
- GLM-5.3 —utilise→ slime (TECHNOLOGIE, 0.95)
- slime —permet→ de brancher maths, code, sandboxes, vérificateurs et environnements agentiques long-horizon comme de la génération de données plutôt que comme des modifications de la boucle d'entraînement, entraînement, rollout et buffer tenant sur un seul flux de données (AFFIRMATION, 0.93)
- slime —améliore→ le débit d'entraînement RL end-to-end de plus de 2,3× sur les tâches de codage long-horizon, avec un écart moyen de log-probabilités entraînement-rollout contrôlé à 1e-7 (MESURE, 0.9)
- GLM-5.3 —utilise→ SAO (METHODOLOGIE, 0.92)
- GLM-5.3 —utilise→ IndexShare (TECHNOLOGIE, 0.9)
- Z.ai —affirme_que→ la difficulté du passage à l'échelle du post-entraînement se déplace du modèle vers l'environnement, un environnement utile devant être exécutable, vérifiable et proche du travail professionnel réel, et devant exister en grand nombre (AFFIRMATION, 0.95)
- synthèse d'environnements de tâches —permet→ de produire des environnements long-horizon exécutables et leur signal de récompense à partir de motifs collectés sur du travail réel, un agent juge vérifiant au préalable que chaque tâche est effectivement résoluble (AFFIRMATION, 0.93)
- synthèse d'environnements de tâches —recommande→ de synthétiser les vérificateurs sans accès à la solution de référence et de ne les admettre qu'après trois contrôles négatifs — oracle, no-op et unsolved-state — afin d'obtenir une récompense binaire assez fiable pour entraîner directement dessus (AFFIRMATION, 0.94)
- synthèse d'environnements de tâches —réduit→ les raccourcis de récompense, les trajectoires de solveur servant à les découvrir puis à les fermer (AFFIRMATION, 0.9)
- GLM-5.3 —mesure→ 28,3 sur Terminal-Bench 3.0 contre 4,6 pour GLM-5.2, 66,9 sur DeepSWE v1.1 contre 46,2, et 28,5 sur Agents' Last Exam contre 23,8 (MESURE, 0.96)
- Z.ai —a_créé→ Z.ai Code Bench (TECHNOLOGIE, 0.95)
- Z.ai Code Bench —réduit→ le risque de contamination par les jeux de test publics, au prix de l'impossibilité pour un tiers de répliquer la mesure (AFFIRMATION, 0.88)
- GLM-5.3 —mesure→ 34,5 % sur Z.ai Code Bench à environ 75 000 tokens de sortie par tâche en effort Max, contre 23,4 % à 96 000 pour GLM-5.2, et 31,4 % à environ 50 000 tokens en effort High (MESURE, 0.93)
- GLM-5.3 —surpasse→ Claude Opus 4.8 (TECHNOLOGIE, 0.85)
- Z.ai —affirme_que→ GLM-5.3 est le modèle à poids ouverts le plus capable pour le codage, revendication que son propre tableau ne départage pas face à Kimi K3, à égalité sur les benchmarks de codage renseignés pour les deux (AFFIRMATION, 0.86)
- GLM-5.3 —concurrence→ Kimi K3 (TECHNOLOGIE, 0.92)
- Z.ai —affirme_que→ la capacité cyber s'est développée plus vite qu'attendu alors que les données et environnements de découverte de vulnérabilités avaient été délibérément introduits dans le mélange d'entraînement, le résultat visé étant précisément d'améliorer le modèle sur ce terrain (AFFIRMATION, 0.95)
- GLM-5.3 —permet→ de raisonner à travers plusieurs étapes d'exploitation et de former des plans cohérents pour des chaînes d'exploitation complètes, au lieu d'identifier des failles isolées (AFFIRMATION, 0.93)
- GLM-5.3 —mesure→ 84,5 % sur CyberGym contre 77,2 % pour GLM-5.2, 54,4 % sur ExploitBench contre 24,4 %, et 105 puis 130 tâches ExploitGym sous budgets normalisés de 2 h et 6 h contre 29 et 39 (MESURE, 0.95)
- Z.ai —affirme_que→ plus un benchmark se situe haut dans la chaîne d'exploitation, plus le gain sur GLM-5.2 est grand et plus l'écart au frontier fermé reste large — « Capability is growing fastest exactly where we are furthest behind » (CITATION, 0.96)
- GLM-5.3 —observé_dans→ 2 436 vulnérabilités identifiées dans 269 projets open source après revue d'experts, tri et déduplication, couvrant noyaux système, systèmes d'exploitation, moteurs de navigateur, infrastructure open source, applications web et protocoles réseau (MESURE, 0.93)
- Z.ai —a_créé→ Z.ai Security Disclosure Ledger (TECHNOLOGIE, 0.94)
- Z.ai Security Disclosure Ledger —mesure→ 2 436 constats suivis dont 53 publiquement divulgués et 2 383 sous embargo, 1 097 de sévérité critique ou élevée, la plus ancienne faille introduite en 1981 et une durée de vie moyenne de 26,6 ans avant découverte (MESURE, 0.94)
- Z.ai —collabore_avec→ plusieurs équipes de sécurité en Chine, non nommées, pour exécuter les modèles GLM contre des bases de code réelles depuis GLM-5.2 (AFFIRMATION, 0.9)
- Z.ai —prédit→ la publication des poids de GLM-5.3 dans les deux semaines suivant le lancement, une fois l'évaluation de sûreté et le durcissement terminés (AFFIRMATION, 0.95)
- publication de poids ouverts —s_applique_à→ un calendrier annoncé plutôt qu'à une procédure publiée : ni définition du durcissement, ni critère de non-publication, ni évaluateur tiers ne sont fournis (AFFIRMATION, 0.88)
- GLM-5.3 —observé_dans→ Claude Code (TECHNOLOGIE, 0.94)
- Claude Code —est_instance_de→ harnais d'évaluation agentique de référence, utilisé en version 2.1.207 par un laboratoire concurrent pour mesurer son propre modèle et ceux d'Anthropic et d'OpenAI (AFFIRMATION, 0.89)
- Artificial Analysis —mesure→ les scores GDPval-AA v2 et FrontierSWE du tableau comparatif, seules évaluations attribuées à un tiers, ainsi que les débits par modèle servant à normaliser les budgets ExploitGym (MESURE, 0.92)
- GLM-5.3 —s_oppose_à→ la désactivation du raisonnement : thinking.type « disabled » n'est plus supporté et fait échouer la requête, trois niveaux low, high et max étant proposés avec max par défaut (AFFIRMATION, 0.95)
- GLM Coding Plan —utilise→ un système de quotas en points comptés séparément pour l'entrée, l'entrée en cache et la sortie, les appels hors heures pleines — hors 14h-18h UTC+8 du lundi au vendredi — consommant 50 % du barème (AFFIRMATION, 0.93)
- ZCode —permet→ un taux de cache revendiqué à plus de 98 %, un mode Goal qui planifie, code, teste et vérifie jusqu'à atteinte de la cible, et un pilotage à distance des tâches longues via WeChat ou Feishu (AFFIRMATION, 0.9)

---
Canonical: https://www.thekb.eu/it/fiches/zai-glm-53-emergent-cyber-2026-08-14/
