Aller au contenu

root / tags / deepswe

#DeepSWE

2 fiches

Qualité & Sécurité

GLM-5.3: Frontier Coding with Emergent Cyber Capabilities

Billet d'annonce publié sur le **blog officiel de Z.ai** (ex-Zhipu AI, laboratoire chinois) le **14 août 2026**, **sans signature individuelle**, ~2 000 mots plus notes de bas de page. Il annonce **GLM-5.3**, successeur de GLM-5.2, avec une thèse méthodologique en tête d'article : *« Scaling post-training is all we did for GLM-5.3. »* Même modèle de base que GLM-5.2 — *« every gain comes from post-training »*. Trois annonces. **(A) Un modèle de codage à poids ouverts** : +50 % revendiqués sur **Z.ai Code Bench**, benchmark maison non publié. **(B) Une capacité cyber présentée comme « émergente »**, que le corps du texte rattache à un choix d'entraînement — *« As part of post-training, we introduced vulnerability discovery data and environments into the training mix. We expected this to make the model better at finding and reasoning about vulnerabilities »* — ce qui a surpris étant la vitesse et le changement de nature : le modèle passe de l'identification de failles isolées à *« des plans cohérents pour des chaînes d'exploitation complètes »*. Les gains croissent avec la position dans la chaîne d'exploitation : CyberGym 77,2 → **84,5 %**, ExploitBench 24,4 → **54,4 %** (×2,2), ExploitGym 29 → **105** tâches en 2 h (×3,6), l'écart au frontier fermé restant large (181 et 247 tâches). Z.ai le formule ainsi : *« Capability is growing fastest exactly where we are furthest behind. »* Le billet publie également un **Z.ai Security Disclosure Ledger** : **2 436 vulnérabilités identifiées dans 269 projets open source** — noyaux, OS, moteurs de navigateur, infrastructure, applications web, protocoles réseau —, la plus ancienne introduite en **1981**, durée de vie moyenne avant découverte **26,6 ans**, dont **53 divulguées** et **2 383 sous embargo**. **(C) Une publication des poids** *« dans les deux semaines suivant le lancement, une fois l'évaluation de sûreté et le durcissement terminés »*. Contribution méthodologique la plus réutilisable : la **synthèse d'environnements et de vérificateurs**, ces derniers produits sans accès à la solution de référence et admis seulement après un triptyque de contrôles négatifs — **oracle**, **no-op**, **unsolved-state**. Toutes les évaluations agentiques sont conduites **dans Claude Code 2.1.207**.

#GLM-5.3#GLM-5.2#Z.ai

**Z.ai** (anciennement **Zhipu AI**) · laboratoire d'IA chinois · éditeur de la famille **GLM**. Billet **institutionnel et non signé** : aucun auteur nommé · aucun chercheur mis en avant · aucun lien vers un rapport technique ou une carte de modèle. Publié le **14 août 2026**. La page est une SPA React — le HTML servi est un `<div id="root">` vide · et le texte comme les scores ont dû être extraits du bundle `glm-5.3-BCnx8T5_.js` · où ils figurent en valeurs source.

Économie & Marché

GPT-5.6 Sol, Terra, Luna : comment OpenAI rebat les cartes du coding agentique et du pricing

Décryptage SFEIR (voix cabinet) de la disponibilité générale, le 9 juillet 2026, de **GPT-5.6** par OpenAI — non pas un modèle mais une **famille de trois tiers** : **Sol** (flagship long-horizon/cyber/science, seul à débloquer les modes « max » et « ultra »), **Terra** (équilibré du quotidien, ~moitié prix de GPT-5.5) et **Luna** (rapide/économique, haut volume). Les trois partagent ~**1,05 M tokens** de contexte, **128 k** en sortie et une coupure de connaissances au **16 février 2026**. Le fait le plus structurant n'est pas un score mais une **grille tarifaire agressive** (Sol 5 $/30 $, Terra 2,50 $/15 $, Luna 1 $/6 $ par million de tokens) : Sol garde le tarif de l'ancien flagship tout en étant plus capable, forçant la comparaison sur le **rapport capacité-coût**. Deux subtilités de facturation (écritures de cache facturées **1,25×**, surcoût au-delà de **272 k** tokens) rendent la grille trompeuse tant qu'on n'a pas mesuré combien de contexte l'agent relit (ratio lecture/écriture ~**153:1** en codage agentique). Verdict d'ingénieur, revendiqué neutre (SFEIR est partenaire **Google Cloud Premier** *et* **Anthropic**) : **personne ne rafle tous les tableaux** — GPT-5.6 domine Terminal-Bench 2.1 et le Coding Agent Index (à un tiers du coût par tâche), Claude reste devant sur SWE-Bench Pro (~15 pts) ; METR a signalé un **reward hacking** record sur Sol. Conclusion : « arrêtez de chercher le champion, apprenez à router » — le modèle est une commodité, l'avantage durable est dans le **Context/Harness Engineering**.

#GPT-5.6#Sol#Terra

SFEIR (voix éditoriale du cabinet)