Aller au contenu

root / tags / zhipu-ai

#Zhipu AI

2 fiches

Qualité & Sécurité

GLM-5.3: Frontier Coding with Emergent Cyber Capabilities

Billet d'annonce publié sur le **blog officiel de Z.ai** (ex-Zhipu AI, laboratoire chinois) le **14 août 2026**, **sans signature individuelle**, ~2 000 mots plus notes de bas de page. Il annonce **GLM-5.3**, successeur de GLM-5.2, avec une thèse méthodologique en tête d'article : *« Scaling post-training is all we did for GLM-5.3. »* Même modèle de base que GLM-5.2 — *« every gain comes from post-training »*. Trois annonces. **(A) Un modèle de codage à poids ouverts** : +50 % revendiqués sur **Z.ai Code Bench**, benchmark maison non publié. **(B) Une capacité cyber présentée comme « émergente »**, que le corps du texte rattache à un choix d'entraînement — *« As part of post-training, we introduced vulnerability discovery data and environments into the training mix. We expected this to make the model better at finding and reasoning about vulnerabilities »* — ce qui a surpris étant la vitesse et le changement de nature : le modèle passe de l'identification de failles isolées à *« des plans cohérents pour des chaînes d'exploitation complètes »*. Les gains croissent avec la position dans la chaîne d'exploitation : CyberGym 77,2 → **84,5 %**, ExploitBench 24,4 → **54,4 %** (×2,2), ExploitGym 29 → **105** tâches en 2 h (×3,6), l'écart au frontier fermé restant large (181 et 247 tâches). Z.ai le formule ainsi : *« Capability is growing fastest exactly where we are furthest behind. »* Le billet publie également un **Z.ai Security Disclosure Ledger** : **2 436 vulnérabilités identifiées dans 269 projets open source** — noyaux, OS, moteurs de navigateur, infrastructure, applications web, protocoles réseau —, la plus ancienne introduite en **1981**, durée de vie moyenne avant découverte **26,6 ans**, dont **53 divulguées** et **2 383 sous embargo**. **(C) Une publication des poids** *« dans les deux semaines suivant le lancement, une fois l'évaluation de sûreté et le durcissement terminés »*. Contribution méthodologique la plus réutilisable : la **synthèse d'environnements et de vérificateurs**, ces derniers produits sans accès à la solution de référence et admis seulement après un triptyque de contrôles négatifs — **oracle**, **no-op**, **unsolved-state**. Toutes les évaluations agentiques sont conduites **dans Claude Code 2.1.207**.

#GLM-5.3#GLM-5.2#Z.ai

**Z.ai** (anciennement **Zhipu AI**) · laboratoire d'IA chinois · éditeur de la famille **GLM**. Billet **institutionnel et non signé** : aucun auteur nommé · aucun chercheur mis en avant · aucun lien vers un rapport technique ou une carte de modèle. Publié le **14 août 2026**. La page est une SPA React — le HTML servi est un `<div id="root">` vide · et le texte comme les scores ont dû être extraits du bundle `glm-5.3-BCnx8T5_.js` · où ils figurent en valeurs source.

Économie & Marché

GLM-5.2 leads open weights models and sits at #3 overall on GDPval-AA, a real-world agentic work benchmark

Annonce-benchmark d'**Artificial Analysis** (plateforme d'évaluation indépendante de modèles IA, via X/Twitter + page modèle) : **GLM-5.2** de **Z.ai** (Zhipu AI, @Zai_org) devient **le meilleur modèle à poids ouverts** et se hisse **#3 au classement général** de **GDPval-AA**, un benchmark de *travail de connaissance économiquement valorisable* du monde réel (tâches longue-horizon, multi-tours, agentiques). GLM-5.2 marque **1524 Elo**, derrière les seuls **Claude Fable 5 (1783)** et **Claude Opus 4.8 (1615)**, et à parité avec **GPT-5.5 (xhigh, 1509)**. Il devance d'une large marge le modèle ouvert suivant (**MiniMax-M3, 1408**) et de nombreux modèles propriétaires : **Gemini 3.5 Flash (1357)**, **Qwen 3.7 Max (1289)**, **Muse Spark (1158)**. Les tâches sont réellement agentiques : **~31 tours par tâche** en moyenne sur **1 999 matchs**. La même hiérarchie tient sur l'**Artificial Analysis Intelligence Index** (1er open weights), l'**Agentic Index** (#3) et **AA-Briefcase** (#3, devant GPT-5.5 xhigh, derrière Fable 5). Point saillant : un modèle **open weights** sous **licence MIT**, **MoE 753 Mds de paramètres / 40 Mds actifs**, contexte **1M tokens**, tarifé **1,40 $/4,40 $ par 1M tokens** entrée/sortie, rivalise avec la frontière propriétaire sur le travail agentique — un vrai pas pour les modèles ouverts.

#GLM-5.2#Z.ai#Zhipu AI

Artificial Analysis (@ArtificialAnlys)