# zai-glm-53-emergent-cyber-2026-08-14

## Veille

Ankündigungsbeitrag, veröffentlicht im **offiziellen Z.ai-Blog** (ehemals Zhipu AI, chinesisches Labor) am **14. August 2026**, **ohne namentliche Autorenangabe**, ~2.000 Wörter plus Fußnoten. Er kündigt **GLM-5.3** an, den Nachfolger von GLM-5.2, und eröffnet mit einer methodischen These: *« Scaling post-training is all we did for GLM-5.3. »* Dasselbe Basismodell wie GLM-5.2 — *« every gain comes from post-training »*. Drei Ankündigungen. **(A) Ein Coding-Modell mit offenen Gewichten**: +50 % beansprucht auf **Z.ai Code Bench**, einem unveröffentlichten internen Benchmark. **(B) Eine als „emergent" dargestellte Cyber-Fähigkeit**, die der Fließtext auf eine Trainingsentscheidung zurückführt — *« As part of post-training, we introduced vulnerability discovery data and environments into the training mix. We expected this to make the model better at finding and reasoning about vulnerabilities »* — überraschend waren die Geschwindigkeit und der Wandel in der Natur: Das Modell geht von der Identifizierung isolierter Schwachstellen zu *« coherent plans for complete exploitation chains »* über. Die Gewinne wachsen mit der Position in der Exploitation-Kette: CyberGym 77,2 → **84,5 %**, ExploitBench 24,4 → **54,4 %** (×2,2), ExploitGym 29 → **105** Aufgaben in 2 h (×3,6), wobei der Abstand zur geschlossenen Frontier weiterhin groß bleibt (181 und 247 Aufgaben). Z.ai formuliert es so: *« Capability is growing fastest exactly where we are furthest behind. »* Der Beitrag veröffentlicht zudem ein **Z.ai Security Disclosure Ledger**: **2.436 identifizierte Schwachstellen in 269 Open-Source-Projekten** — Kernel, Betriebssysteme, Browser-Engines, Infrastruktur, Webanwendungen, Netzwerkprotokolle — die älteste eingeführt **1981**, durchschnittliche Lebensdauer bis zur Entdeckung **26,6 Jahre**, davon **53 offengelegt** und **2.383 unter Embargo**. **(C) Eine Gewichtsfreigabe** *« within two weeks of launch, once safety evaluation and hardening are complete »*. Der am ehesten übertragbare methodische Beitrag: **Synthese von Umgebungen und Verifiern**, wobei Letztere ohne Zugriff auf die Referenzlösung erzeugt und erst nach einem Triptychon negativer Kontrollen zugelassen werden — **oracle**, **no-op**, **unsolved-state**. Alle agentischen Evaluierungen werden **in Claude Code 2.1.207** durchgeführt.

## Titre Article

GLM-5.3: Frontier Coding with Emergent Cyber Capabilities

## Date

2026-08-14

## URL

https://z.ai/blog/glm-5.3

## Keywords

GLM-5.3, GLM-5.2, Z.ai, Zhipu AI, offene Gewichte, Open-Weights, chinesisches Labor, Post-Training, Post-Training-Scaling, RL-Scaling, Umgebungssynthese, Long-Horizon-Aufgaben, SAO, IndexShare, slime, Megatron, SGLang, Multi-Teacher-OPD, synthetischer Verifier, Verifier-Synthese, binäre Belohnung, Reward Hacking, Oracle-Kontrolle, No-op-Kontrolle, Unsolved-State-Kontrolle, Judge-Agent, human-in-the-loop, Cyber-Fähigkeit, Schwachstellenerkennung, Exploitation-Kette, CyberGym, ExploitBench, ExploitGym, koordinierte Offenlegung, Security Disclosure Ledger, Embargo, 2436 Schwachstellen, 269 Projekte, 2383 unter Embargo, 1981, 26, 6 Jahre, Dual-Use, Gewichtsfreigabe, Sicherheitsevaluierung, Hardening, Terminal-Bench 3.0, DeepSWE, SWE-Marathon, PostTrainBench, Agents' Last Exam, GDPval-AA v2, Z.ai Code Bench, privater Benchmark, Benchmark-Kontamination, Token-Effizienz, reasoning_effort, Claude Code 2.1.207, Evaluierungs-Harness, Artificial Analysis, Kimi K3, GLM Coding Plan, Nebenzeit-Tarife, ZCode

## Authors

**Z.ai** (anciennement **Zhipu AI**), laboratoire d'IA chinois, éditeur de la famille **GLM**. Billet **institutionnel et non signé** : aucun auteur nommé, aucun chercheur mis en avant, aucun lien vers un rapport technique ou une carte de modèle. Publié le **14 août 2026**. La page est une SPA React — le HTML servi est un `<div id="root">` vide, et le texte comme les scores ont dû être extraits du bundle `glm-5.3-BCnx8T5_.js`, où ils figurent en valeurs source.

## Ton

**Profil**: Produktankündigung eines Modell-Labors, Register eines **verkürzten technischen Berichts** — dicht, quantifiziert, frei von werblichen Superlativen. Zielgruppe: ML-Ingenieure, Plattform-Teams, API-Käufer. Eine Ingenieursnotiz, deren einziges werbliches Element der Titel ist.

**Stil**: Der Einstieg ist eine methodische These, keine Leistungsbehauptung — *« Scaling post-training is all we did for GLM-5.3 »*, erster Satz, fett gesetzt: Die Ankündigung sagt weniger „hier ist ein besseres Modell" als „hier ist, was wir für am kosteneffizientesten befunden haben." Das Eingeständnis des Rückstands wird unverblümt offen gelegt: *« Mythos 5 remains well ahead at 181 and 247 tasks »*, dann *« Capability is growing fastest exactly where we are furthest behind. »* Der Titel verwendet *« emergent »*, wo der Fließtext eine gezielte Ergänzung des Trainingsmixes um Daten zur Schwachstellenerkennung beschreibt; das einzige Element, das der Text als unerwartet bezeichnet, ist das Tempo. Die Methodenbeschreibung ist großzügiger als der Branchendurchschnitt — die Kette aus Umgebungs- und Verifier-Synthese wird Schritt für Schritt dargelegt und schließt mit einer eingeräumten Einschränkung: *« These pipelines still require a meaningful amount of human-in-the-loop work. »* Die Fußnoten tragen die operative Wahrheit: Temperaturen, Kontextfenster, Timeouts, avg@3, Anti-Cheat-Whitelists und vor allem die **an den offiziellen Harnesses vorgenommenen Änderungen** (Anti-Cheat-Prüfungen bei `strip-clone` wegen Falsch-Positiven entfernt, `--extra-index-url` bei `parameter-golf` und `trimul-cuda` ergänzt, um Docker-Builds zu reparieren) — eine seltene Offenlegung, die die Scores wiederum unvergleichbar mit offiziellen Leaderboards macht.

**Signalphrasen**:
- ***« Scaling post-training is all we did for GLM-5.3 »***
- ***« every gain comes from post-training »***
- ***« much of the difficulty in scaling post-training moves from the model to the environment »***
- ***« a judge agent then attempts each task to verify that it is actually solvable »***
- ***« Verifiers are synthesized without access to the reference solution »***
- ***« it began to reason across multiple stages of exploitation, forming coherent plans for complete exploitation chains »***
- ***« Capability is growing fastest exactly where we are furthest behind »***
- ***« We will release the weights in two weeks after launch, once safety evaluation and hardening are complete »***
- ***« Disabling thinking is no longer supported »***

**Epistemische Position**: eine interessierte Partei, transparent bezüglich ihrer Methode, die ihre eigene Leistung beurteilt. Verlässlich hinsichtlich *wie* das Modell trainiert und *unter welchen Bedingungen* es gemessen wurde; nicht verifizierbar hinsichtlich *wie viel* es wert ist — die zentrale Behauptung stützt sich auf einen privaten Benchmark, und die Wettbewerber-Scores wurden von Z.ai erstellt, mit drei zugeschriebenen Ausnahmen (GDPval-AA v2 und FrontierSWE **Artificial Analysis**, Toolathlon Verified über den offiziellen Evaluierungsdienst).

## Pense-betes

- **Datum / Quelle**: **14. August 2026**, offizieller **Z.ai**-Blog, unsignierter Beitrag. Seite als React-SPA gebaut, nicht durch ein gewöhnliches `curl | lynx` erfassbar; der Bundle-Name ist gehasht und daher instabil.
- **Zentrale Einordnung**: dasselbe Basismodell wie GLM-5.2, sämtliche Gewinne stammen aus dem Post-Training. Der Begriff *« emergent »* im Titel bezieht sich im Fließtext auf eine **Fortschrittsrate** — die Fähigkeit selbst wurde gezielt trainiert. ### Die Cyber-Kurve: der Gewinn wächst mit der Position in der Kette | Benchmark | Was gemessen wird | GLM-5.2 → GLM-5.3 | Faktor | Bester Wert der Tabelle | |---|---|---|---|---| | CyberGym | Identifizierung und Validierung einer Schwachstelle im White-Box-Verfahren | 77,2 → **84,5 %** | ×1,09 | **GLM-5.3** (vor 83,8 / 83,6) | | ExploitBench | Schlussfolgern über die Ausnutzung realer Schwachstellen | 24,4 → **54,4 %** | **×2,2** | 78,0 (geschlossenes Modell) | | ExploitGym (2 h) | abgeschlossene Exploitation-Aufgaben, normiertes Budget | 29 → **105** | **×3,6** | 181 (geschlossenes Modell) | | ExploitGym (6 h) | dasselbe, 6 h | 39 → **130** | ×3,3 | 247 (geschlossenes Modell) | Zwei gleichzeitige, beide zutreffende Lesarten: Z.ai bleibt überall dort weit hinter der geschlossenen Frontier zurück, wo Exploitation real wird, und genau dort ist sein Fortschritt am schnellsten — für einen zusätzlichen Monat Post-Training auf demselben Basismodell. Zitierfalle: ExploitGym-Budgets sind **durchsatznormiert**, die API-Zeit wird anhand der TPS jedes Modells umskaliert (115 für GLM-5.3, 40 für Kimi K3, 47 für Qwen3.8-Max, Quelle: Artificial Analysis). Das sind keine Echtzeitstunden. ### Das Security Disclosure Ledger | Zähler | Wert | Anteil | |---|---|---| | Erfasste Funde | **2.436** | 100 % | | Öffentlich offengelegt | **53** | **2,2 %** | | Unter Embargo | **2.383** | **97,8 %** | | Kritisch & Hoch | 1.097 | 45 % | | Betroffene OSS-Projekte | **269** | — | Ein Embargo fällt unter die übliche koordinierte Offenlegung; auffällig sind die Größe des Rückstands und die Veröffentlichungsrate. Vier Punkte, die der Beitrag nicht behandelt: die Fristenpolitik, die tatsächliche Benachrichtigung der Maintainer der 269 Projekte, die Identität der erwähnten *« several security teams in China »* und was mit dem Embargo geschieht, sobald die Gewichte freigegeben werden — ein öffentliches Modell, das diese Schwachstellen erneut auffinden kann, macht das Embargo faktisch hinfällig. ### Der Zeitplan für die Gewichtsfreigabe *« We will release the weights in two weeks after launch, once safety evaluation and hardening are complete. »* Nicht spezifiziert: die Definition von *Hardening* für offene Gewichte, die Kriterien, die eine Verzögerung auslösen würden, die Existenz eines benannten externen Prüfers oder Red Teams sowie jegliche Verpflichtung zur Veröffentlichung des Berichts. Der Zeitplan ist an den kommerziellen Launch gekoppelt, nicht an den Abschluss eines Prozesses. Praktische Konsequenz: Stand 14. August 2026 ist GLM-5.3 ein API-Modell, gepaart mit einer Öffnungsabsicht, nicht mit einer vor der tatsächlichen Freigabe errichteten Reversibilitätsarchitektur. Vergleich mit dem Umgang mit der Gewichtsfreigabe in [[zuckerberg-meta-future-is-for-everyone-superintelligence-2026-08-10]]. ### Die Behauptung „leistungsfähigstes Open-Weights-Modell für Coding" Über die 7 Benchmarks der Gruppe *Coding*, in denen **Kimi K3** in Z.ais Tabelle aufgeführt ist: | Benchmark | GLM-5.3 | Kimi K3 | Vorteil | |---|---|---|---| | Terminal Bench 2.1 | 88,2 | **88,3** | Kimi K3 | | Terminal-Bench 3.0 | **28,3** | 17,4 | GLM-5.3 (deutlich) | | DeepSWE (v1.1) | 66,9 | **67,5** | Kimi K3 | | NL2Repo | 58 | 58 | Gleichstand | | ProgramBench | **19** | 17,5 | GLM-5.3 | | SWE-Marathon (v1.1) | 42,5 | **48,1** | Kimi K3 (deutlich) | | PostTrainBench | **39,8** | 32 | GLM-5.3 | Das ergibt **3:3 mit einem Unentschieden**. Zwei engere Behauptungen halten hingegen stand: *« open-source SOTA on Terminal Bench 3.0 »* (28,3 gegenüber 17,4) und bei *Agents' Last Exam* (28,5 gegenüber 27,6 für Kimi K3 und 27 für Qwen3.8-Max, innerhalb von 0,1 Punkt des besten geschlossenen Modells der Tabelle). ### Der Gewinn einer Post-Training-Generation | Benchmark | GLM-5.2 | GLM-5.3 | Abstand | |---|---|---|---| | Terminal-Bench 3.0 | 4,6 | **28,3** | **×6,2** | | SWE-Marathon (v1.1) | 19,4 | **42,5** | ×2,2 | | DeepSWE (v1.1) | 46,2 | **66,9** | +20,7 Pkt | | AutomationBench | 26,2 | **48,2** | +22 Pkt | | Agents' Last Exam | 23,8 | **28,5** | +4,7 Pkt | | GDPval-AA v2 | 1508 | **1769** | +261 | Lesart: Bei langen agentischen Aufgaben erweist sich die Trainingsumgebung als kosteneffizienterer Hebel als frisches Pretraining — *« much of the difficulty in scaling post-training moves from the model to the environment »*. Ein Abstand von ×6,2 innerhalb eines einzigen Monats deutet zudem darauf hin, dass der Benchmark weit von der Sättigung entfernt war: Terminal-Bench 3.0 liegt weiterhin bei 28,3 %, das heißt, mehr als sieben von zehn Aufgaben scheitern. Kontext zu agentischen Benchmarks: [[patel-block-buzz-teams-tokens-benchmarks-2026-08-06]]. ### Kosten pro erfolgreicher Aufgabe (Z.ai Code Bench, privat) | Konfiguration | Score | Output-Token / Aufgabe | |---|---|---| | GLM-5.2, Max Effort | 23,4 % | 96K | | **GLM-5.3, Max Effort** | **34,5 %** | **~75K** | | GLM-5.3, High Effort | 31,4 % | ~50K | | Claude Opus 4.8 (Z.ai-Messung) | 29,5 % | 120K | | Claude Fable 5, Max Effort | **39,5 %** | nicht offengelegt | Das eigentliche Verkaufsargument ist das Verhältnis: +5 Punkte gegenüber Opus 4.8 bei rund 1,6× weniger Output-Token. Drei Vorbehalte, die zusammen zu betrachten sind: interner und privater Benchmark, selbst bewerteter Vergleich, und Fable 5 bleibt weiterhin vorn — Z.ai veröffentlicht das selbst. Die Kosten der Output-Token sind zudem nicht die Gesamtkosten (Input, Cache, Anzahl der Turns). ### Die Verifikationskette, außerhalb von Z.ai übertragbar 1. Recherche-Agenten sammeln Aufgabenmuster aus realer Arbeit und wandeln sie in ausführbare Long-Horizon-Umgebungen mit mehrstufigen Abhängigkeiten und verdecktem Zustand um. 2. Ein **Judge-Agent versucht jede Aufgabe**, um zu verifizieren, dass sie tatsächlich lösbar ist. 3. **Verifier werden ohne Zugriff auf die Referenzlösung synthetisiert** — sie können die Antwort also nicht kodieren. 4. Solver-Trajektorien werden genutzt, um Belohnungs-Abkürzungen aufzudecken und zu schließen. 5. Ein Verifier wird nur zugelassen, wenn er **oracle** (akzeptiert die wahre Lösung), **no-op** (verwirft Nichtstun) und **unsolved-state** (verwirft den Ausgangszustand) besteht. Erst dann *« produce a binary reward reliable enough to train on directly »*. Die Punkte 3 und 5 lassen sich auf jede automatische Testgenerierung übertragen: Ein Test, der beim Originalcode nicht rot fehlschlägt, beweist nichts. Dieselbe Anforderung wie formuliert in [[dumortier-marketing-ai-os-verification-2026-08-12]]. Von Z.ai eingeräumte Einschränkung: *« These pipelines still require a meaningful amount of human-in-the-loop work. »* ### Claude Code als Evaluierungs-Harness Sieben in den Fußnoten dokumentierte Evaluierungen werden *« in Claude Code 2.1.207 »* durchgeführt — Terminal-Bench 2.1 und 3.0, ALE, CyberGym, ExploitGym, ExploitBench, PostTrainBench, SWE-Marathon. Ein chinesisches Labor misst dort sein Frontier-Modell und die seiner Wettbewerber und zitiert die Version als Abhängigkeit. Unberücksichtigtes Korollar: die Übertragbarkeit der Scores auf ein anderes Harness. ### API-Bruch und Preisgestaltung
- *« Disabling thinking is no longer supported by GLM-5.3 »*: `thinking.type: "disabled"` führt zum Fehlschlagen der Anfrage. Vorgeschriebene Migration: Umstellung auf `enabled` **und** `reasoning_effort: "low"` **vor** der Änderung der Modell-ID. Drei Stufen `low` / `high` / `max`, **Standard `max`**. Die Mindestkosten eines Aufrufs steigen dadurch; bei jeder hochvolumigen, wenig komplexen Arbeitslast muss die Umstellung auf `low` der ID-Änderung vorausgehen.
- **GLM Coding Plan** verwendet Punktekontingente, getrennt gezählt für Input, gecachten Input und Output. **Spitzenzeiten 14:00–18:00 UTC+8, Montag bis Freitag**, alles andere zu 50 % des Satzes — für ein europäisches Team entspricht das Spitzenfenster somit 08:00–12:00 Uhr Pariser Zeit. Zugehöriges ZCode-Angebot: behauptet *« 98%+ cache hit rate »*, ~30 % mehr effektive Token, 1,5-facher Kontingent-Boost bis **31. August 2026**, *Goal*-Modus und *Remote Control* über **WeChat oder Feishu**. ### Drei interne Widersprüche, nicht weiterzugeben 1. *« 1,097 medium-to-high severity issues »* widerspricht der eigenen Seitenleiste desselben Beitrags: kritisch 107 + hoch 990 = **1.097**, mittel 1.286 gesondert. Zitieren als „1.097 kritische oder schwerwiegende Schwachstellen". 2. *« the oldest dating back roughly 40 years »* widerspricht der Seitenleiste (*« introduced in 1981 »*, *« 45 YEARS OF IMPACT »*). **1981** und eine durchschnittliche Lebensdauer von **26,6 Jahren** verwenden. 3. Der Fließtext schreibt „Mythos 5" die Werte 83,8 / 78,0 / 181-247 zu, die die Tabelle „Fable 5 (w/ fallback)" zuschreibt. Es handelt sich um zwei unterschiedliche Anthropic-Modelle, und der Beitrag klärt nicht, welches gemeint ist. Diese Werte keinem benannten Modell zuschreiben. ### Trainingsinfrastruktur Post-Training auf **slime** (Z.ais Open-Source-Framework), **Megatron** für das Training, **SGLang** für den Rollout, wobei Training, Rollout und Buffer auf einem einzigen Datenstrom liegen — Umgebungen werden wie Datengenerierung eingebunden, nicht als Loop-Modifikationen. Behauptete Gewinne: durchschnittliche Log-Wahrscheinlichkeitslücke zwischen Training und Rollout auf **1e-7** kontrolliert, **Multi-Teacher-OPD** mit dynamischem Wechsel und Prefetching, gemeinsame Router-/slime-Planung, insgesamt **mehr als das 2,3-Fache End-to-End-Durchsatz** bei Long-Horizon-Coding-RL-Aufgaben. Zugrundeliegende Publikationen: **IndexShare** (arXiv 2603.12201) und **SAO** (arXiv 2607.07508). ### Zitierhygiene
- Alles aus **Z.ai Code Bench** ist konstruktionsbedingt nicht verifizierbar: als *« per an unpublished internal benchmark »* zitieren.
- Jeder Wettbewerber-Score in der Tabelle wurde von Z.ai selbst erstellt, mit Ausnahme von GDPval-AA v2 und FrontierSWE (Artificial Analysis) sowie Toolathlon Verified (offizieller Dienst).
- Die öffentlichen Harnesses wurden modifiziert; die Scores sind nicht mit offiziellen Leaderboards vergleichbar.
- Die Verbindung zum Souveränitätsdossier ist direkt: Drei Tage zuvor kündigte [[nunez-mistral-gigawatt-compute-europeen-venturebeat-2026-08-11]] an, dass Mistral AI GLM-5.2 unter europäischen regionalen Kontrollen hostet. Die Sicherheitsevaluierungen, die Mistral eigenen Angaben zufolge bei Drittanbietermodellen durchführt, wurden nicht öffentlich beschrieben.

## RésuméDe400mots

Ankündigungsbeitrag, veröffentlicht am **14. August 2026** im **Z.ai**-Blog (ehemals Zhipu AI), **unsigniert**, zur Einführung von **GLM-5.3**.

**Die methodische These.** *« Scaling post-training is all we did for GLM-5.3. »* Dasselbe Basismodell wie GLM-5.2: **der gesamte Gewinn stammt aus dem Post-Training**, aufbauend auf dem Stack des vorherigen Zyklus — **IndexShare** (langer Kontext), **SAO** (Long-Horizon-RL) und **slime** (asynchrones Training, Megatron + SGLang). Der Engpass hat sich vom Modell zur **Umgebung** verlagert: Z.ai beschreibt Pipelines, die Umgebungen und Belohnungssignal **synthetisieren** — ein Judge-Agent verifiziert die Lösbarkeit, **Verifier werden ohne Zugriff auf die Referenzlösung synthetisiert** und erst nach einem Triptychon aus **oracle-/no-op-/unsolved-state**-Kontrollen zugelassen. Die Arbeit bleibt *« human-in-the-loop »*. Der End-to-End-RL-Durchsatz verbesserte sich um **mehr als das 2,3-Fache**.

**Die Coding-Ergebnisse.** Terminal-Bench 3.0 steigt von **4,6 auf 28,3**, DeepSWE v1.1 von **46,2 auf 66,9**, Agents' Last Exam von **23,8 auf 28,5**. Auf **Z.ai Code Bench**, einem **internen, privaten** Benchmark, +50 % gegenüber GLM-5.2, bei gleichzeitigem Gewinn an **Token-Effizienz**: 34,5 % bei ~75K Output-Token mit Max-Effort (gegenüber 23,4 % bei 96K für GLM-5.2) und 31,4 % bei ~50K mit High-Effort — vor Claude Opus 4.8 (29,5 % bei 120K). **Claude Fable 5 bleibt mit 39,5 % vorn.** Die Behauptung *« most capable open-weights model for coding »* **ergibt sich nicht aus der Tabelle**: gegenüber **Kimi K3** steht es **3:3 mit einem Unentschieden**.

**Die Cyber-Fähigkeit.** Als *« emergent »* dargestellt, wurde sie **gezielt trainiert** — der Beitrag schreibt *« we expected this to make the model better »*. Überraschend waren die **Geschwindigkeit** und der Wechsel von isolierten Schwachstellen zur **vollständigen Exploitation-Kette**. CyberGym **84,5 %** (bester Wert der Tabelle), ExploitBench **54,4 %** (×2,2), ExploitGym **105/130 Aufgaben** (×3,6 gegenüber GLM-5.2, durchsatznormierte Budgets). Schlüsselsatz: ***« Capability is growing fastest exactly where we are furthest behind. »***

**Die schwerwiegendste Zahl.** In Zusammenarbeit mit chinesischen Sicherheitsteams identifizierte das Modell **2.436 Schwachstellen in 269 Open-Source-Projekten** — Kernel, Betriebssysteme, Browser-Engines, Netzwerkprotokolle — die älteste eingeführt **1981**, durchschnittliche Lebensdauer **26,6 Jahre**. Das **Security Disclosure Ledger** zeigt **53 offengelegte** und **2.383 unter Embargo stehende**: **2,2 % veröffentlicht**.

**Governance.** Die Gewichte werden angekündigt *« in two weeks, once safety evaluation and hardening are complete »* — **ein Datum, kein Kriterium**: keine Definition von Hardening, keine Bedingung für eine Nicht-Freigabe, kein externer Prüfer.

**Sonstiges.** `thinking.type: "disabled"` **wird nicht mehr unterstützt** (Migration erforderlich); GLM Coding Plan-Kontingente in Punkten, **50 % außerhalb von 14:00–18:00 UTC+8**; **nahezu alle Evaluierungen werden in Claude Code 2.1.207 durchgeführt**.

## GrapheDeConnaissance

- Z.ai —publie→ GLM-5.3 (TECHNOLOGIE, 0.98)
- GLM-5.3 —est_variante_de→ GLM (TECHNOLOGIE, 0.97)
- Z.ai —publie→ GLM (TECHNOLOGIE, 0.98)
- GLM-5.3 —remplace→ GLM-5.2 (TECHNOLOGIE, 0.97)
- GLM-5.3 —est_basé_sur→ GLM-5.2 (TECHNOLOGIE, 0.96)
- Z.ai —affirme_que→ GLM-5.3 utilise le même modèle de base que GLM-5.2 et que la totalité du gain provient du post-entraînement — « Scaling post-training is all we did » (CITATION, 0.97)
- GLM-5.3 —utilise→ slime (TECHNOLOGIE, 0.95)
- slime —permet→ de brancher maths, code, sandboxes, vérificateurs et environnements agentiques long-horizon comme de la génération de données plutôt que comme des modifications de la boucle d'entraînement, entraînement, rollout et buffer tenant sur un seul flux de données (AFFIRMATION, 0.93)
- slime —améliore→ le débit d'entraînement RL end-to-end de plus de 2,3× sur les tâches de codage long-horizon, avec un écart moyen de log-probabilités entraînement-rollout contrôlé à 1e-7 (MESURE, 0.9)
- GLM-5.3 —utilise→ SAO (METHODOLOGIE, 0.92)
- GLM-5.3 —utilise→ IndexShare (TECHNOLOGIE, 0.9)
- Z.ai —affirme_que→ la difficulté du passage à l'échelle du post-entraînement se déplace du modèle vers l'environnement, un environnement utile devant être exécutable, vérifiable et proche du travail professionnel réel, et devant exister en grand nombre (AFFIRMATION, 0.95)
- synthèse d'environnements de tâches —permet→ de produire des environnements long-horizon exécutables et leur signal de récompense à partir de motifs collectés sur du travail réel, un agent juge vérifiant au préalable que chaque tâche est effectivement résoluble (AFFIRMATION, 0.93)
- synthèse d'environnements de tâches —recommande→ de synthétiser les vérificateurs sans accès à la solution de référence et de ne les admettre qu'après trois contrôles négatifs — oracle, no-op et unsolved-state — afin d'obtenir une récompense binaire assez fiable pour entraîner directement dessus (AFFIRMATION, 0.94)
- synthèse d'environnements de tâches —réduit→ les raccourcis de récompense, les trajectoires de solveur servant à les découvrir puis à les fermer (AFFIRMATION, 0.9)
- GLM-5.3 —mesure→ 28,3 sur Terminal-Bench 3.0 contre 4,6 pour GLM-5.2, 66,9 sur DeepSWE v1.1 contre 46,2, et 28,5 sur Agents' Last Exam contre 23,8 (MESURE, 0.96)
- Z.ai —a_créé→ Z.ai Code Bench (TECHNOLOGIE, 0.95)
- Z.ai Code Bench —réduit→ le risque de contamination par les jeux de test publics, au prix de l'impossibilité pour un tiers de répliquer la mesure (AFFIRMATION, 0.88)
- GLM-5.3 —mesure→ 34,5 % sur Z.ai Code Bench à environ 75 000 tokens de sortie par tâche en effort Max, contre 23,4 % à 96 000 pour GLM-5.2, et 31,4 % à environ 50 000 tokens en effort High (MESURE, 0.93)
- GLM-5.3 —surpasse→ Claude Opus 4.8 (TECHNOLOGIE, 0.85)
- Z.ai —affirme_que→ GLM-5.3 est le modèle à poids ouverts le plus capable pour le codage, revendication que son propre tableau ne départage pas face à Kimi K3, à égalité sur les benchmarks de codage renseignés pour les deux (AFFIRMATION, 0.86)
- GLM-5.3 —concurrence→ Kimi K3 (TECHNOLOGIE, 0.92)
- Z.ai —affirme_que→ la capacité cyber s'est développée plus vite qu'attendu alors que les données et environnements de découverte de vulnérabilités avaient été délibérément introduits dans le mélange d'entraînement, le résultat visé étant précisément d'améliorer le modèle sur ce terrain (AFFIRMATION, 0.95)
- GLM-5.3 —permet→ de raisonner à travers plusieurs étapes d'exploitation et de former des plans cohérents pour des chaînes d'exploitation complètes, au lieu d'identifier des failles isolées (AFFIRMATION, 0.93)
- GLM-5.3 —mesure→ 84,5 % sur CyberGym contre 77,2 % pour GLM-5.2, 54,4 % sur ExploitBench contre 24,4 %, et 105 puis 130 tâches ExploitGym sous budgets normalisés de 2 h et 6 h contre 29 et 39 (MESURE, 0.95)
- Z.ai —affirme_que→ plus un benchmark se situe haut dans la chaîne d'exploitation, plus le gain sur GLM-5.2 est grand et plus l'écart au frontier fermé reste large — « Capability is growing fastest exactly where we are furthest behind » (CITATION, 0.96)
- GLM-5.3 —observé_dans→ 2 436 vulnérabilités identifiées dans 269 projets open source après revue d'experts, tri et déduplication, couvrant noyaux système, systèmes d'exploitation, moteurs de navigateur, infrastructure open source, applications web et protocoles réseau (MESURE, 0.93)
- Z.ai —a_créé→ Z.ai Security Disclosure Ledger (TECHNOLOGIE, 0.94)
- Z.ai Security Disclosure Ledger —mesure→ 2 436 constats suivis dont 53 publiquement divulgués et 2 383 sous embargo, 1 097 de sévérité critique ou élevée, la plus ancienne faille introduite en 1981 et une durée de vie moyenne de 26,6 ans avant découverte (MESURE, 0.94)
- Z.ai —collabore_avec→ plusieurs équipes de sécurité en Chine, non nommées, pour exécuter les modèles GLM contre des bases de code réelles depuis GLM-5.2 (AFFIRMATION, 0.9)
- Z.ai —prédit→ la publication des poids de GLM-5.3 dans les deux semaines suivant le lancement, une fois l'évaluation de sûreté et le durcissement terminés (AFFIRMATION, 0.95)
- publication de poids ouverts —s_applique_à→ un calendrier annoncé plutôt qu'à une procédure publiée : ni définition du durcissement, ni critère de non-publication, ni évaluateur tiers ne sont fournis (AFFIRMATION, 0.88)
- GLM-5.3 —observé_dans→ Claude Code (TECHNOLOGIE, 0.94)
- Claude Code —est_instance_de→ harnais d'évaluation agentique de référence, utilisé en version 2.1.207 par un laboratoire concurrent pour mesurer son propre modèle et ceux d'Anthropic et d'OpenAI (AFFIRMATION, 0.89)
- Artificial Analysis —mesure→ les scores GDPval-AA v2 et FrontierSWE du tableau comparatif, seules évaluations attribuées à un tiers, ainsi que les débits par modèle servant à normaliser les budgets ExploitGym (MESURE, 0.92)
- GLM-5.3 —s_oppose_à→ la désactivation du raisonnement : thinking.type « disabled » n'est plus supporté et fait échouer la requête, trois niveaux low, high et max étant proposés avec max par défaut (AFFIRMATION, 0.95)
- GLM Coding Plan —utilise→ un système de quotas en points comptés séparément pour l'entrée, l'entrée en cache et la sortie, les appels hors heures pleines — hors 14h-18h UTC+8 du lundi au vendredi — consommant 50 % du barème (AFFIRMATION, 0.93)
- ZCode —permet→ un taux de cache revendiqué à plus de 98 %, un mode Goal qui planifie, code, teste et vérifie jusqu'à atteinte de la cible, et un pilotage à distance des tâches longues via WeChat ou Feishu (AFFIRMATION, 0.9)

---
Canonical: https://www.thekb.eu/de/fiches/zai-glm-53-emergent-cyber-2026-08-14/
