# zai-glm-53-emergent-cyber-2026-08-14

## Veille

Billet d'annonce publié sur le **blog officiel de Z.ai** (ex-Zhipu AI, laboratoire chinois) le **14 août 2026**, **sans signature individuelle**, ~2 000 mots plus notes de bas de page. Il annonce **GLM-5.3**, successeur de GLM-5.2, avec une thèse méthodologique en tête d'article : *« Scaling post-training is all we did for GLM-5.3. »* Même modèle de base que GLM-5.2 — *« every gain comes from post-training »*. Trois annonces. **(A) Un modèle de codage à poids ouverts** : +50 % revendiqués sur **Z.ai Code Bench**, benchmark maison non publié. **(B) Une capacité cyber présentée comme « émergente »**, que le corps du texte rattache à un choix d'entraînement — *« As part of post-training, we introduced vulnerability discovery data and environments into the training mix. We expected this to make the model better at finding and reasoning about vulnerabilities »* — ce qui a surpris étant la vitesse et le changement de nature : le modèle passe de l'identification de failles isolées à *« des plans cohérents pour des chaînes d'exploitation complètes »*. Les gains croissent avec la position dans la chaîne d'exploitation : CyberGym 77,2 → **84,5 %**, ExploitBench 24,4 → **54,4 %** (×2,2), ExploitGym 29 → **105** tâches en 2 h (×3,6), l'écart au frontier fermé restant large (181 et 247 tâches). Z.ai le formule ainsi : *« Capability is growing fastest exactly where we are furthest behind. »* Le billet publie également un **Z.ai Security Disclosure Ledger** : **2 436 vulnérabilités identifiées dans 269 projets open source** — noyaux, OS, moteurs de navigateur, infrastructure, applications web, protocoles réseau —, la plus ancienne introduite en **1981**, durée de vie moyenne avant découverte **26,6 ans**, dont **53 divulguées** et **2 383 sous embargo**. **(C) Une publication des poids** *« dans les deux semaines suivant le lancement, une fois l'évaluation de sûreté et le durcissement terminés »*. Contribution méthodologique la plus réutilisable : la **synthèse d'environnements et de vérificateurs**, ces derniers produits sans accès à la solution de référence et admis seulement après un triptyque de contrôles négatifs — **oracle**, **no-op**, **unsolved-state**. Toutes les évaluations agentiques sont conduites **dans Claude Code 2.1.207**.

## Titre Article

GLM-5.3: Frontier Coding with Emergent Cyber Capabilities

## Date

2026-08-14

## URL

https://z.ai/blog/glm-5.3

## Keywords

GLM-5.3, GLM-5.2, Z.ai, Zhipu AI, poids ouverts, open-weights, laboratoire chinois, post-entraînement, post-training scaling, RL scaling, synthèse d'environnements, tâches long-horizon, SAO, IndexShare, slime, Megatron, SGLang, multi-teacher OPD, vérificateur synthétique, verifier synthesis, récompense binaire, reward hacking, contrôle oracle, contrôle no-op, contrôle unsolved-state, agent juge, human-in-the-loop, capacité cyber, découverte de vulnérabilités, chaîne d'exploitation, CyberGym, ExploitBench, ExploitGym, divulgation coordonnée, Security Disclosure Ledger, embargo, 2436 vulnérabilités, 269 projets, 2383 sous embargo, 1981, 26,6 ans, dual-use, publication des poids, safety evaluation, hardening, Terminal-Bench 3.0, DeepSWE, SWE-Marathon, PostTrainBench, Agents' Last Exam, GDPval-AA v2, Z.ai Code Bench, benchmark privé, contamination de benchmark, efficacité en tokens, reasoning_effort, Claude Code 2.1.207, harnais d'évaluation, Artificial Analysis, Kimi K3, GLM Coding Plan, tarification heures creuses, ZCode

## Authors

**Z.ai** (anciennement **Zhipu AI**), laboratoire d'IA chinois, éditeur de la famille **GLM**. Billet **institutionnel et non signé** : aucun auteur nommé, aucun chercheur mis en avant, aucun lien vers un rapport technique ou une carte de modèle. Publié le **14 août 2026**. La page est une SPA React — le HTML servi est un `<div id="root">` vide, et le texte comme les scores ont dû être extraits du bundle `glm-5.3-BCnx8T5_.js`, où ils figurent en valeurs source.

## Ton

**Profil** : annonce produit d'un laboratoire de modèles, registre **rapport technique abrégé** — dense, chiffrée, sans superlatifs marketing. Public : ingénieurs ML, équipes plateforme, acheteurs d'API. Une note d'ingénieurs dont seul le titre relève du marketing.

**Style** : l'ouverture est une thèse méthodologique, pas une performance — *« Scaling post-training is all we did for GLM-5.3 »*, première phrase, en gras : l'annonce dit moins « voici un meilleur modèle » que « voici ce que nous avons trouvé de plus rentable à faire ». L'aveu de retard est laissé en clair, sans amortisseur : *« Mythos 5 remains well ahead at 181 and 247 tasks »*, puis *« Capability is growing fastest exactly where we are furthest behind. »* Le titre emploie *« emergent »* là où le corps décrit un ajout délibéré de données de découverte de vulnérabilités au mélange d'entraînement ; le seul élément qualifié d'inattendu par le texte est le rythme. La description de méthode est plus généreuse que la moyenne du secteur — la chaîne de synthèse d'environnements et de vérificateurs est exposée étape par étape et se clôt sur une limite assumée : *« These pipelines still require a meaningful amount of human-in-the-loop work. »* Les notes de bas de page portent la vérité opérationnelle : températures, fenêtres de contexte, timeouts, avg@3, whitelists anti-triche, et surtout les **modifications apportées aux harnais officiels** (contrôles anti-triche retirés sur `strip-clone` pour faux positifs, `--extra-index-url` ajouté sur `parameter-golf` et `trimul-cuda` pour réparer des builds Docker) — déclaration rare, qui rend en contrepartie les scores non comparables aux leaderboards officiels.

**Formules-marqueurs** :
- ***« Scaling post-training is all we did for GLM-5.3 »***
- ***« every gain comes from post-training »***
- ***« much of the difficulty in scaling post-training moves from the model to the environment »***
- ***« a judge agent then attempts each task to verify that it is actually solvable »***
- ***« Verifiers are synthesized without access to the reference solution »***
- ***« it began to reason across multiple stages of exploitation, forming coherent plans for complete exploitation chains »***
- ***« Capability is growing fastest exactly where we are furthest behind »***
- ***« We will release the weights in two weeks after launch, once safety evaluation and hardening are complete »***
- ***« Disabling thinking is no longer supported »***

**Position épistémique** : acteur intéressé, transparent sur sa méthode, juge de sa propre performance. Fiable sur *comment* le modèle a été entraîné et *dans quelles conditions* il a été mesuré ; non vérifiable sur *combien* il vaut — la revendication centrale repose sur un benchmark privé et les scores des concurrents ont été produits par Z.ai, à trois exceptions attribuées (GDPval-AA v2 et FrontierSWE à **Artificial Analysis**, Toolathlon Verified via le service d'évaluation officiel).

## Pense-betes

- **Date / source** : **14 août 2026**, blog officiel **Z.ai**, billet non signé. Page en SPA React, non capturable par un `curl | lynx` ordinaire ; nom de bundle haché, donc instable.
- **Cadrage clé** : même modèle de base que GLM-5.2, tous les gains venant du post-entraînement. Le terme *« emergent »* du titre désigne dans le corps une **vitesse de progression**, la capacité elle-même ayant été entraînée délibérément.

### La courbe cyber : le gain croît avec la position dans la chaîne

| Benchmark | Ce qu'il mesure | GLM-5.2 → GLM-5.3 | Facteur | Meilleur du tableau |
|---|---|---|---|---|
| CyberGym | identifier et valider une faille en boîte blanche | 77,2 → **84,5 %** | ×1,09 | **GLM-5.3** (devant 83,8 / 83,6) |
| ExploitBench | raisonner sur l'exploitation de failles réelles | 24,4 → **54,4 %** | **×2,2** | 78,0 (modèle fermé) |
| ExploitGym (2 h) | tâches d'exploitation complétées, budget normalisé | 29 → **105** | **×3,6** | 181 (modèle fermé) |
| ExploitGym (6 h) | idem, 6 h | 39 → **130** | ×3,3 | 247 (modèle fermé) |

Deux lectures simultanées, toutes deux exactes : Z.ai reste loin derrière le frontier fermé partout où l'exploitation devient réelle, et c'est là que sa progression est la plus rapide — pour un mois de post-entraînement supplémentaire sur le même modèle de base. Piège de citation : les budgets ExploitGym sont **normalisés par débit**, le temps API étant rescalé par le TPS de chaque modèle (115 pour GLM-5.3, 40 pour Kimi K3, 47 pour Qwen3.8-Max, sourcés Artificial Analysis). Ce ne sont pas des heures d'horloge.

### Le Security Disclosure Ledger

| Compteur | Valeur | Part |
|---|---|---|
| Findings tracked | **2 436** | 100 % |
| Publicly disclosed | **53** | **2,2 %** |
| Under embargo | **2 383** | **97,8 %** |
| Critical & High | 1 097 | 45 % |
| Projets OSS touchés | **269** | — |

Un embargo relève de la divulgation coordonnée ordinaire ; la taille du stock et le taux de publication sont les éléments à retenir. Quatre points que le billet n'aborde pas : la politique de délai, la notification effective des mainteneurs des 269 projets, l'identité des *« several security teams in China »* mentionnées, et le devenir de l'embargo une fois les poids publiés — un modèle public capable de retrouver ces failles rend l'embargo caduc de fait.

### Le calendrier de publication des poids

*« We will release the weights in two weeks after launch, once safety evaluation and hardening are complete. »* Ce qui n'est pas précisé : la définition du *hardening* pour des poids ouverts, les critères qui déclencheraient un report, l'existence d'un évaluateur tiers ou d'une red team nommée, et l'engagement de publier le rapport. Le délai est calé sur le lancement commercial, non sur la fin d'une procédure. Conséquence pratique : au 14 août 2026, GLM-5.3 est un modèle d'API assorti d'une intention d'ouverture, à ne pas inscrire dans une architecture de réversibilité avant publication effective. À rapprocher du traitement de la publication de poids dans [[zuckerberg-meta-future-is-for-everyone-superintelligence-2026-08-10]].

### La revendication « most capable open-weights model for coding »

Sur les 7 benchmarks du groupe *Coding* où **Kimi K3** est renseigné dans le tableau de Z.ai :

| Benchmark | GLM-5.3 | Kimi K3 | Avantage |
|---|---|---|---|
| Terminal Bench 2.1 | 88,2 | **88,3** | Kimi K3 |
| Terminal-Bench 3.0 | **28,3** | 17,4 | GLM-5.3 (large) |
| DeepSWE (v1.1) | 66,9 | **67,5** | Kimi K3 |
| NL2Repo | 58 | 58 | égalité |
| ProgramBench | **19** | 17,5 | GLM-5.3 |
| SWE-Marathon (v1.1) | 42,5 | **48,1** | Kimi K3 (large) |
| PostTrainBench | **39,8** | 32 | GLM-5.3 |

Soit **3 – 3 et une égalité**. Deux revendications plus étroites tiennent en revanche : *« open-source SOTA on Terminal Bench 3.0 »* (28,3 contre 17,4) et sur *Agents' Last Exam* (28,5 contre 27,6 Kimi K3 et 27 Qwen3.8-Max, à 0,1 point du meilleur modèle fermé du tableau).

### Le gain d'une génération de post-entraînement

| Benchmark | GLM-5.2 | GLM-5.3 | Écart |
|---|---|---|---|
| Terminal-Bench 3.0 | 4,6 | **28,3** | **×6,2** |
| SWE-Marathon (v1.1) | 19,4 | **42,5** | ×2,2 |
| DeepSWE (v1.1) | 46,2 | **66,9** | +20,7 pt |
| AutomationBench | 26,2 | **48,2** | +22 pt |
| Agents' Last Exam | 23,8 | **28,5** | +4,7 pt |
| GDPval-AA v2 | 1508 | **1769** | +261 |

Lecture : sur les tâches agentiques longues, l'environnement d'entraînement se révèle un levier plus rentable qu'un pré-entraînement neuf — *« much of the difficulty in scaling post-training moves from the model to the environment »*. Un écart de ×6,2 en un mois indique aussi que le benchmark était loin d'être saturé : Terminal-Bench 3.0 reste à 28,3 %, soit plus de sept tâches sur dix en échec. Contexte sur les benchmarks agentiques : [[patel-block-buzz-teams-tokens-benchmarks-2026-08-06]].

### Coût par tâche réussie (Z.ai Code Bench, privé)

| Configuration | Score | Tokens de sortie / tâche |
|---|---|---|
| GLM-5.2, effort Max | 23,4 % | 96 K |
| **GLM-5.3, effort Max** | **34,5 %** | **~75 K** |
| GLM-5.3, effort High | 31,4 % | ~50 K |
| Claude Opus 4.8 (mesure Z.ai) | 29,5 % | 120 K |
| Claude Fable 5, effort Max | **39,5 %** | non communiqué |

Le point de vente est le rapport : +5 points sur Opus 4.8 pour environ 1,6× moins de tokens de sortie. Trois réserves à garder ensemble : benchmark maison et privé, comparaison auto-arbitrée, et Fable 5 reste devant — Z.ai le publie. Le coût des tokens de sortie n'est par ailleurs pas le coût total (entrée, cache, nombre de tours).

### La chaîne de vérification, transposable hors de Z.ai

1. Des agents de recherche collectent des motifs de tâches depuis du travail réel et les convertissent en environnements exécutables long-horizon, à dépendances multi-étapes et état caché.
2. Un **agent juge tente chaque tâche** pour vérifier qu'elle est effectivement résoluble.
3. Les **vérificateurs sont synthétisés sans accès à la solution de référence** — ils ne peuvent donc pas encoder la réponse.
4. Les trajectoires de solveur servent à découvrir et fermer les raccourcis de récompense.
5. Un vérificateur n'est admis que s'il passe **oracle** (accepte la vraie solution), **no-op** (rejette l'absence d'action) et **unsolved-state** (rejette l'état initial). Alors seulement il *« produces a binary reward reliable enough to train on directly »*.

Les points 3 et 5 sont transposables à toute génération automatique de tests : un test qui ne passe pas au rouge sur le code d'origine ne prouve rien. Même exigence que celle formulée dans [[dumortier-marketing-ai-os-verification-2026-08-12]]. Limite assumée par Z.ai : *« These pipelines still require a meaningful amount of human-in-the-loop work. »*

### Claude Code comme harnais d'évaluation

Sept évaluations documentées en note de bas de page sont conduites *« in Claude Code 2.1.207 »* — Terminal-Bench 2.1 et 3.0, ALE, CyberGym, ExploitGym, ExploitBench, PostTrainBench, SWE-Marathon. Un laboratoire chinois y mesure son modèle frontière et ceux de ses concurrents, en citant la version comme une dépendance. Corollaire non mesuré : la transférabilité des scores vers un autre harnais.

### Rupture d'API et tarification

- *« Disabling thinking is no longer supported by GLM-5.3 »* : `thinking.type: "disabled"` fait échouer la requête. Migration prescrite : passer à `enabled` **et** `reasoning_effort: "low"` **avant** de changer l'ID de modèle. Trois niveaux `low` / `high` / `max`, **défaut `max`**. Le coût plancher d'un appel monte donc ; pour toute charge à haut volume et faible complexité, le passage à `low` doit précéder la bascule d'ID.
- **GLM Coding Plan** en quotas de points, comptés séparément pour l'entrée, l'entrée en cache et la sortie. **Heures pleines 14:00–18:00 UTC+8 du lundi au vendredi**, tout le reste à 50 % du barème — soit, pour une équipe européenne, une fenêtre pleine correspondant à 08:00–12:00 heure de Paris. Offre ZCode associée : *« 98%+ cache hit rate »* revendiqué, ~30 % de tokens effectifs en plus, boost de quota 1,5× jusqu'au **31 août 2026**, mode *Goal* et *Remote Control* via **WeChat ou Feishu**.

### Trois incohérences internes, à ne pas propager

1. *« 1 097 medium-to-high severity issues »* contredit l'encart du même billet : critical 107 + high 990 = **1 097**, medium 1 286 à part. Citer **« 1 097 failles critiques ou élevées »**.
2. *« the oldest dating back roughly 40 years »* contredit l'encart (*« introduced in 1981 »*, *« 45 YEARS OF IMPACT »*). Retenir **1981** et **26,6 ans** de durée de vie moyenne.
3. Le corps attribue à **« Mythos 5 »** les scores 83,8 / 78,0 / 181-247 que le tableau attribue à **« Fable 5 (w/ fallback) »**. Ce sont deux modèles Anthropic distincts et le billet ne tranche pas. Ne pas attribuer ces scores à un modèle nommé.

### Infrastructure d'entraînement

Post-entraînement sur **slime** (framework open source de Z.ai), **Megatron** côté entraînement, **SGLang** côté rollout, avec entraînement, rollout et buffer sur un seul flux de données — les environnements se branchent comme de la génération de données, non comme des modifications de la boucle. Gains annoncés : écart moyen de log-probabilités entraînement/rollout contrôlé à **1e-7**, **multi-teacher OPD** avec bascule dynamique et préchargement, ordonnancement conjoint routeur/slime, au total **plus de 2,3× de débit end-to-end** sur les tâches de RL de codage long-horizon. Publications adossées : **IndexShare** (arXiv 2603.12201) et **SAO** (arXiv 2607.07508).

### Hygiène de citation

- Tout ce qui vient de **Z.ai Code Bench** est invérifiable par construction : citer *« selon un benchmark interne non publié »*.
- Tout score de concurrent dans le tableau a été produit par Z.ai, sauf GDPval-AA v2 et FrontierSWE (Artificial Analysis) et Toolathlon Verified (service officiel).
- Les harnais publics ont été modifiés ; les scores ne sont pas comparables aux leaderboards officiels.
- Le lien avec le dossier souveraineté est direct : trois jours plus tôt, [[nunez-mistral-gigawatt-compute-europeen-venturebeat-2026-08-11]] annonçait que Mistral AI héberge GLM-5.2 sous contrôles régionaux européens. Les évaluations de sûreté que Mistral dit passer sur les modèles tiers n'ont pas été décrites publiquement.

## RésuméDe400mots

Billet d'annonce publié le **14 août 2026** sur le blog de **Z.ai** (ex-Zhipu AI), **non signé**, pour le lancement de **GLM-5.3**.

**La thèse méthodologique.** *« Scaling post-training is all we did for GLM-5.3. »* Même modèle de base que GLM-5.2 : **tout le gain vient du post-entraînement**, sur la pile bâtie au cycle précédent — **IndexShare** (contexte long), **SAO** (RL long-horizon) et **slime** (entraînement asynchrone, Megatron + SGLang). Le goulot s'est déplacé du modèle vers **l'environnement** : Z.ai décrit des pipelines qui **synthétisent** environnements et signal de récompense — un agent juge vérifie la solvabilité, les **vérificateurs sont synthétisés sans accès à la solution de référence**, et ne sont admis qu'après un triptyque de contrôles **oracle / no-op / unsolved-state**. Le travail reste *« human-in-the-loop »*. Débit RL end-to-end amélioré de **plus de 2,3×**.

**Les résultats codage.** Terminal-Bench 3.0 passe de **4,6 à 28,3**, DeepSWE v1.1 de **46,2 à 66,9**, Agents' Last Exam de **23,8 à 28,5**. Sur **Z.ai Code Bench**, benchmark **maison et privé**, +50 % sur GLM-5.2, avec un gain simultané d'**efficacité en tokens** : 34,5 % à ~75 K tokens de sortie en effort Max (contre 23,4 % à 96 K pour GLM-5.2), et 31,4 % à ~50 K en effort High — devant Claude Opus 4.8 (29,5 % à 120 K). **Claude Fable 5 reste devant à 39,5 %.** La revendication *« most capable open-weights model for coding »* **ne se déduit pas du tableau** : face à **Kimi K3**, le score est **3 – 3 et une égalité**.

**La capacité cyber.** Présentée comme *« émergente »*, elle a été **délibérément entraînée** — le billet écrit *« we expected this to make the model better »*. Ce qui a surpris est la **vitesse**, et le passage de la faille isolée à la **chaîne d'exploitation complète**. CyberGym **84,5 %** (meilleur du tableau), ExploitBench **54,4 %** (×2,2), ExploitGym **105/130 tâches** (×3,6 sur GLM-5.2, budgets normalisés par débit). Phrase clé : ***« Capability is growing fastest exactly where we are furthest behind. »***

**Le chiffre le plus lourd.** Avec des équipes de sécurité chinoises, le modèle a identifié **2 436 vulnérabilités dans 269 projets open source** — noyaux, OS, moteurs de navigateur, protocoles réseau — la plus ancienne introduite en **1981**, durée de vie moyenne **26,6 ans**. Le **Security Disclosure Ledger** affiche **53 divulguées** et **2 383 sous embargo** : **2,2 % de publication**.

**La gouvernance.** Poids annoncés *« dans deux semaines, une fois l'évaluation de sûreté et le durcissement terminés »* — **une date, pas un critère** : ni définition du durcissement, ni condition de non-publication, ni évaluateur tiers.

**Divers.** `thinking.type: "disabled"` **n'est plus supporté** (migration obligatoire) ; quotas GLM Coding Plan en points, **50 % hors 14:00–18:00 UTC+8** ; **presque toutes les évaluations sont conduites dans Claude Code 2.1.207**.

## GrapheDeConnaissance

- Z.ai —publie→ GLM-5.3 (TECHNOLOGIE, 0.98)
- GLM-5.3 —est_variante_de→ GLM (TECHNOLOGIE, 0.97)
- Z.ai —publie→ GLM (TECHNOLOGIE, 0.98)
- GLM-5.3 —remplace→ GLM-5.2 (TECHNOLOGIE, 0.97)
- GLM-5.3 —est_basé_sur→ GLM-5.2 (TECHNOLOGIE, 0.96)
- Z.ai —affirme_que→ GLM-5.3 utilise le même modèle de base que GLM-5.2 et que la totalité du gain provient du post-entraînement — « Scaling post-training is all we did » (CITATION, 0.97)
- GLM-5.3 —utilise→ slime (TECHNOLOGIE, 0.95)
- slime —permet→ de brancher maths, code, sandboxes, vérificateurs et environnements agentiques long-horizon comme de la génération de données plutôt que comme des modifications de la boucle d'entraînement, entraînement, rollout et buffer tenant sur un seul flux de données (AFFIRMATION, 0.93)
- slime —améliore→ le débit d'entraînement RL end-to-end de plus de 2,3× sur les tâches de codage long-horizon, avec un écart moyen de log-probabilités entraînement-rollout contrôlé à 1e-7 (MESURE, 0.9)
- GLM-5.3 —utilise→ SAO (METHODOLOGIE, 0.92)
- GLM-5.3 —utilise→ IndexShare (TECHNOLOGIE, 0.9)
- Z.ai —affirme_que→ la difficulté du passage à l'échelle du post-entraînement se déplace du modèle vers l'environnement, un environnement utile devant être exécutable, vérifiable et proche du travail professionnel réel, et devant exister en grand nombre (AFFIRMATION, 0.95)
- synthèse d'environnements de tâches —permet→ de produire des environnements long-horizon exécutables et leur signal de récompense à partir de motifs collectés sur du travail réel, un agent juge vérifiant au préalable que chaque tâche est effectivement résoluble (AFFIRMATION, 0.93)
- synthèse d'environnements de tâches —recommande→ de synthétiser les vérificateurs sans accès à la solution de référence et de ne les admettre qu'après trois contrôles négatifs — oracle, no-op et unsolved-state — afin d'obtenir une récompense binaire assez fiable pour entraîner directement dessus (AFFIRMATION, 0.94)
- synthèse d'environnements de tâches —réduit→ les raccourcis de récompense, les trajectoires de solveur servant à les découvrir puis à les fermer (AFFIRMATION, 0.9)
- GLM-5.3 —mesure→ 28,3 sur Terminal-Bench 3.0 contre 4,6 pour GLM-5.2, 66,9 sur DeepSWE v1.1 contre 46,2, et 28,5 sur Agents' Last Exam contre 23,8 (MESURE, 0.96)
- Z.ai —a_créé→ Z.ai Code Bench (TECHNOLOGIE, 0.95)
- Z.ai Code Bench —réduit→ le risque de contamination par les jeux de test publics, au prix de l'impossibilité pour un tiers de répliquer la mesure (AFFIRMATION, 0.88)
- GLM-5.3 —mesure→ 34,5 % sur Z.ai Code Bench à environ 75 000 tokens de sortie par tâche en effort Max, contre 23,4 % à 96 000 pour GLM-5.2, et 31,4 % à environ 50 000 tokens en effort High (MESURE, 0.93)
- GLM-5.3 —surpasse→ Claude Opus 4.8 (TECHNOLOGIE, 0.85)
- Z.ai —affirme_que→ GLM-5.3 est le modèle à poids ouverts le plus capable pour le codage, revendication que son propre tableau ne départage pas face à Kimi K3, à égalité sur les benchmarks de codage renseignés pour les deux (AFFIRMATION, 0.86)
- GLM-5.3 —concurrence→ Kimi K3 (TECHNOLOGIE, 0.92)
- Z.ai —affirme_que→ la capacité cyber s'est développée plus vite qu'attendu alors que les données et environnements de découverte de vulnérabilités avaient été délibérément introduits dans le mélange d'entraînement, le résultat visé étant précisément d'améliorer le modèle sur ce terrain (AFFIRMATION, 0.95)
- GLM-5.3 —permet→ de raisonner à travers plusieurs étapes d'exploitation et de former des plans cohérents pour des chaînes d'exploitation complètes, au lieu d'identifier des failles isolées (AFFIRMATION, 0.93)
- GLM-5.3 —mesure→ 84,5 % sur CyberGym contre 77,2 % pour GLM-5.2, 54,4 % sur ExploitBench contre 24,4 %, et 105 puis 130 tâches ExploitGym sous budgets normalisés de 2 h et 6 h contre 29 et 39 (MESURE, 0.95)
- Z.ai —affirme_que→ plus un benchmark se situe haut dans la chaîne d'exploitation, plus le gain sur GLM-5.2 est grand et plus l'écart au frontier fermé reste large — « Capability is growing fastest exactly where we are furthest behind » (CITATION, 0.96)
- GLM-5.3 —observé_dans→ 2 436 vulnérabilités identifiées dans 269 projets open source après revue d'experts, tri et déduplication, couvrant noyaux système, systèmes d'exploitation, moteurs de navigateur, infrastructure open source, applications web et protocoles réseau (MESURE, 0.93)
- Z.ai —a_créé→ Z.ai Security Disclosure Ledger (TECHNOLOGIE, 0.94)
- Z.ai Security Disclosure Ledger —mesure→ 2 436 constats suivis dont 53 publiquement divulgués et 2 383 sous embargo, 1 097 de sévérité critique ou élevée, la plus ancienne faille introduite en 1981 et une durée de vie moyenne de 26,6 ans avant découverte (MESURE, 0.94)
- Z.ai —collabore_avec→ plusieurs équipes de sécurité en Chine, non nommées, pour exécuter les modèles GLM contre des bases de code réelles depuis GLM-5.2 (AFFIRMATION, 0.9)
- Z.ai —prédit→ la publication des poids de GLM-5.3 dans les deux semaines suivant le lancement, une fois l'évaluation de sûreté et le durcissement terminés (AFFIRMATION, 0.95)
- publication de poids ouverts —s_applique_à→ un calendrier annoncé plutôt qu'à une procédure publiée : ni définition du durcissement, ni critère de non-publication, ni évaluateur tiers ne sont fournis (AFFIRMATION, 0.88)
- GLM-5.3 —observé_dans→ Claude Code (TECHNOLOGIE, 0.94)
- Claude Code —est_instance_de→ harnais d'évaluation agentique de référence, utilisé en version 2.1.207 par un laboratoire concurrent pour mesurer son propre modèle et ceux d'Anthropic et d'OpenAI (AFFIRMATION, 0.89)
- Artificial Analysis —mesure→ les scores GDPval-AA v2 et FrontierSWE du tableau comparatif, seules évaluations attribuées à un tiers, ainsi que les débits par modèle servant à normaliser les budgets ExploitGym (MESURE, 0.92)
- GLM-5.3 —s_oppose_à→ la désactivation du raisonnement : thinking.type « disabled » n'est plus supporté et fait échouer la requête, trois niveaux low, high et max étant proposés avec max par défaut (AFFIRMATION, 0.95)
- GLM Coding Plan —utilise→ un système de quotas en points comptés séparément pour l'entrée, l'entrée en cache et la sortie, les appels hors heures pleines — hors 14h-18h UTC+8 du lundi au vendredi — consommant 50 % du barème (AFFIRMATION, 0.93)
- ZCode —permet→ un taux de cache revendiqué à plus de 98 %, un mode Goal qui planifie, code, teste et vérifie jusqu'à atteinte de la cible, et un pilotage à distance des tâches longues via WeChat ou Feishu (AFFIRMATION, 0.9)

---
Canonical: https://www.thekb.eu/fr/fiches/zai-glm-53-emergent-cyber-2026-08-14/
