Billet d'annonce publié le 14 août 2026 sur le blog de Z.ai (ex-Zhipu AI), non signé, pour le lancement de GLM-5.3.
La thèse méthodologique. « Scaling post-training is all we did for GLM-5.3. » Même modèle de base que GLM-5.2 : tout le gain vient du post-entraînement, sur la pile bâtie au cycle précédent — IndexShare (contexte long), SAO (RL long-horizon) et slime (entraînement asynchrone, Megatron + SGLang). Le goulot s'est déplacé du modèle vers l'environnement : Z.ai décrit des pipelines qui synthétisent environnements et signal de récompense — un agent juge vérifie la solvabilité, les vérificateurs sont synthétisés sans accès à la solution de référence, et ne sont admis qu'après un triptyque de contrôles oracle / no-op / unsolved-state. Le travail reste « human-in-the-loop ». Débit RL end-to-end amélioré de plus de 2,3×.
As part of post-training, we introduced vulnerability discovery data and environments into the training mix. We expected this to make the model better at finding and reasoning about vulnerabilities
Les résultats codage. Terminal-Bench 3.0 passe de 4,6 à 28,3, DeepSWE v1.1 de 46,2 à 66,9, Agents' Last Exam de 23,8 à 28,5. Sur Z.ai Code Bench, benchmark maison et privé, +50 % sur GLM-5.2, avec un gain simultané d'efficacité en tokens : 34,5 % à ~75 K tokens de sortie en effort Max (contre 23,4 % à 96 K pour GLM-5.2), et 31,4 % à ~50 K en effort High — devant Claude Opus 4.8 (29,5 % à 120 K). Claude Fable 5 reste devant à 39,5 %. La revendication « most capable open-weights model for coding » ne se déduit pas du tableau : face à Kimi K3, le score est 3 – 3 et une égalité.
La capacité cyber. Présentée comme « émergente », elle a été délibérément entraînée — le billet écrit « we expected this to make the model better ». Ce qui a surpris est la vitesse, et le passage de la faille isolée à la chaîne d'exploitation complète. CyberGym 84,5 % (meilleur du tableau), ExploitBench 54,4 % (×2,2), ExploitGym 105/130 tâches (×3,6 sur GLM-5.2, budgets normalisés par débit). Phrase clé : « Capability is growing fastest exactly where we are furthest behind. »
Le chiffre le plus lourd. Avec des équipes de sécurité chinoises, le modèle a identifié 2 436 vulnérabilités dans 269 projets open source — noyaux, OS, moteurs de navigateur, protocoles réseau — la plus ancienne introduite en 1981, durée de vie moyenne 26,6 ans. Le Security Disclosure Ledger affiche 53 divulguées et 2 383 sous embargo : 2,2 % de publication.
La gouvernance. Poids annoncés « dans deux semaines, une fois l'évaluation de sûreté et le durcissement terminés » — une date, pas un critère : ni définition du durcissement, ni condition de non-publication, ni évaluateur tiers.
Divers. thinking.type: "disabled" n'est plus supporté (migration obligatoire) ; quotas GLM Coding Plan en points, 50 % hors 14:00–18:00 UTC+8 ; presque toutes les évaluations sont conduites dans Claude Code 2.1.207.