Ankündigungsbeitrag, veröffentlicht am 14. August 2026 im Z.ai-Blog (ehemals Zhipu AI), unsigniert, zur Einführung von GLM-5.3.
Die methodische These. « Scaling post-training is all we did for GLM-5.3. » Dasselbe Basismodell wie GLM-5.2: der gesamte Gewinn stammt aus dem Post-Training, aufbauend auf dem Stack des vorherigen Zyklus — IndexShare (langer Kontext), SAO (Long-Horizon-RL) und slime (asynchrones Training, Megatron + SGLang). Der Engpass hat sich vom Modell zur Umgebung verlagert: Z.ai beschreibt Pipelines, die Umgebungen und Belohnungssignal synthetisieren — ein Judge-Agent verifiziert die Lösbarkeit, Verifier werden ohne Zugriff auf die Referenzlösung synthetisiert und erst nach einem Triptychon aus oracle-/no-op-/unsolved-state-Kontrollen zugelassen. Die Arbeit bleibt « human-in-the-loop ». Der End-to-End-RL-Durchsatz verbesserte sich um mehr als das 2,3-Fache.
As part of post-training, we introduced vulnerability discovery data and environments into the training mix. We expected this to make the model better at finding and reasoning about vulnerabilities
Die Coding-Ergebnisse. Terminal-Bench 3.0 steigt von 4,6 auf 28,3, DeepSWE v1.1 von 46,2 auf 66,9, Agents' Last Exam von 23,8 auf 28,5. Auf Z.ai Code Bench, einem internen, privaten Benchmark, +50 % gegenüber GLM-5.2, bei gleichzeitigem Gewinn an Token-Effizienz: 34,5 % bei ~75K Output-Token mit Max-Effort (gegenüber 23,4 % bei 96K für GLM-5.2) und 31,4 % bei ~50K mit High-Effort — vor Claude Opus 4.8 (29,5 % bei 120K). Claude Fable 5 bleibt mit 39,5 % vorn. Die Behauptung « most capable open-weights model for coding » ergibt sich nicht aus der Tabelle: gegenüber Kimi K3 steht es 3:3 mit einem Unentschieden.
Die Cyber-Fähigkeit. Als « emergent » dargestellt, wurde sie gezielt trainiert — der Beitrag schreibt « we expected this to make the model better ». Überraschend waren die Geschwindigkeit und der Wechsel von isolierten Schwachstellen zur vollständigen Exploitation-Kette. CyberGym 84,5 % (bester Wert der Tabelle), ExploitBench 54,4 % (×2,2), ExploitGym 105/130 Aufgaben (×3,6 gegenüber GLM-5.2, durchsatznormierte Budgets). Schlüsselsatz: « Capability is growing fastest exactly where we are furthest behind. »
Die schwerwiegendste Zahl. In Zusammenarbeit mit chinesischen Sicherheitsteams identifizierte das Modell 2.436 Schwachstellen in 269 Open-Source-Projekten — Kernel, Betriebssysteme, Browser-Engines, Netzwerkprotokolle — die älteste eingeführt 1981, durchschnittliche Lebensdauer 26,6 Jahre. Das Security Disclosure Ledger zeigt 53 offengelegte und 2.383 unter Embargo stehende: 2,2 % veröffentlicht.
Governance. Die Gewichte werden angekündigt « in two weeks, once safety evaluation and hardening are complete » — ein Datum, kein Kriterium: keine Definition von Hardening, keine Bedingung für eine Nicht-Freigabe, kein externer Prüfer.
Sonstiges. thinking.type: "disabled" wird nicht mehr unterstützt (Migration erforderlich); GLM Coding Plan-Kontingente in Punkten, 50 % außerhalb von 14:00–18:00 UTC+8; nahezu alle Evaluierungen werden in Claude Code 2.1.207 durchgeführt.