# zai-glm-53-emergent-cyber-2026-08-14

## Veille

Publicación de anuncio publicada en el **blog oficial de Z.ai** (antes Zhipu AI, laboratorio chino) el **14 de agosto de 2026**, **sin firma individual**, ~2.000 palabras más notas al pie. Anuncia **GLM-5.3**, sucesor de GLM-5.2, y se abre con una tesis metodológica: *« Scaling post-training is all we did for GLM-5.3. »* Mismo modelo base que GLM-5.2 — *« every gain comes from post-training »*. Tres anuncios. **(A) Un modelo de codificación de pesos abiertos**: +50% reivindicado en **Z.ai Code Bench**, un benchmark interno no publicado. **(B) Una capacidad cibernética presentada como "emergente"**, que el cuerpo del texto atribuye a una decisión de entrenamiento — *« As part of post-training, we introduced vulnerability discovery data and environments into the training mix. We expected this to make the model better at finding and reasoning about vulnerabilities »* — lo que resultó sorprendente fue la velocidad y el cambio de naturaleza: el modelo pasa de identificar fallos aislados a *« coherent plans for complete exploitation chains »*. Las ganancias crecen con la posición en la cadena de explotación: CyberGym 77,2 → **84,5%**, ExploitBench 24,4 → **54,4%** (×2,2), ExploitGym 29 → **105** tareas en 2h (×3,6), con una brecha frente a la frontera cerrada que sigue siendo amplia (181 y 247 tareas). Z.ai lo formula así: *« Capability is growing fastest exactly where we are furthest behind. »* La publicación también difunde un **Z.ai Security Disclosure Ledger**: **2.436 vulnerabilidades identificadas en 269 proyectos de código abierto** — núcleos, sistemas operativos, motores de navegador, infraestructura, aplicaciones web, protocolos de red — la más antigua introducida en **1981**, vida media antes del descubrimiento de **26,6 años**, de las cuales **53 divulgadas** y **2.383 bajo embargo**. **(C) Una publicación de los pesos** *« within two weeks of launch, once safety evaluation and hardening are complete »*. El aporte metodológico más reutilizable: la **síntesis de entornos y verificadores**, esta última producida sin acceso a la solución de referencia y admitida solo tras un tríptico de controles negativos — **oracle**, **no-op**, **unsolved-state**. Todas las evaluaciones agénticas se realizan **en Claude Code 2.1.207**.

## Titre Article

GLM-5.3: Frontier Coding with Emergent Cyber Capabilities

## Date

2026-08-14

## URL

https://z.ai/blog/glm-5.3

## Keywords

GLM-5.3, GLM-5.2, Z.ai, Zhipu AI, pesos abiertos, de pesos abiertos, laboratorio chino, post-entrenamiento, escalado del post-entrenamiento, escalado de RL, síntesis de entornos, tareas de largo horizonte, SAO, IndexShare, slime, Megatron, SGLang, multi-teacher OPD, verificador sintético, síntesis de verificadores, recompensa binaria, reward hacking, control oracle, control no-op, control unsolved-state, agente juez, human-in-the-loop, capacidad cibernética, descubrimiento de vulnerabilidades, cadena de explotación, CyberGym, ExploitBench, ExploitGym, divulgación coordinada, Security Disclosure Ledger, embargo, 2436 vulnerabilidades, 269 proyectos, 2383 bajo embargo, 1981, 26, 6 años, doble uso, publicación de pesos, evaluación de seguridad, hardening, Terminal-Bench 3.0, DeepSWE, SWE-Marathon, PostTrainBench, Agents' Last Exam, GDPval-AA v2, Z.ai Code Bench, benchmark privado, contaminación del benchmark, eficiencia de tokens, reasoning_effort, Claude Code 2.1.207, arnés de evaluación, Artificial Analysis, Kimi K3, GLM Coding Plan, precios fuera de hora punta, ZCode

## Authors

**Z.ai** (anciennement **Zhipu AI**), laboratoire d'IA chinois, éditeur de la famille **GLM**. Billet **institutionnel et non signé** : aucun auteur nommé, aucun chercheur mis en avant, aucun lien vers un rapport technique ou une carte de modèle. Publié le **14 août 2026**. La page est une SPA React — le HTML servi est un `<div id="root">` vide, et le texte comme les scores ont dû être extraits du bundle `glm-5.3-BCnx8T5_.js`, où ils figurent en valeurs source.

## Ton

**Perfil**: anuncio de producto de un laboratorio de modelos, registro de **informe técnico abreviado** — denso, cuantificado, sin superlativos de marketing. Audiencia: ingenieros de ML, equipos de plataforma, compradores de API. Una nota de ingenieros cuyo único elemento de marketing es el título.

**Estilo**: la apertura es una tesis metodológica, no una afirmación de rendimiento — *« Scaling post-training is all we did for GLM-5.3 »*, primera frase, en negrita: el anuncio dice menos "aquí hay un modelo mejor" que "aquí está lo que nos pareció más rentable hacer." La admisión de ir a la zaga se deja a la vista, sin matizar: *« Mythos 5 remains well ahead at 181 and 247 tasks »*, y luego *« Capability is growing fastest exactly where we are furthest behind. »* El título usa *« emergent »* donde el cuerpo del texto describe una adición deliberada de datos de descubrimiento de vulnerabilidades a la mezcla de entrenamiento; el único elemento que el texto califica de inesperado es el ritmo. La descripción del método es más generosa que la media del sector — la cadena de síntesis de entornos y verificadores se expone paso a paso y cierra con una limitación reconocida: *« These pipelines still require a meaningful amount of human-in-the-loop work. »* Las notas al pie contienen la verdad operativa: temperaturas, ventanas de contexto, timeouts, avg@3, listas blancas anti-trampa, y sobre todo las **modificaciones hechas a los arneses oficiales** (comprobaciones anti-trampa eliminadas en `strip-clone` por falsos positivos, `--extra-index-url` añadido en `parameter-golf` y `trimul-cuda` para corregir builds de Docker) — una divulgación poco frecuente, que a su vez vuelve las puntuaciones incomparables con las clasificaciones oficiales.

**Frases marcadoras**:
- ***« Scaling post-training is all we did for GLM-5.3 »***
- ***« every gain comes from post-training »***
- ***« much of the difficulty in scaling post-training moves from the model to the environment »***
- ***« a judge agent then attempts each task to verify that it is actually solvable »***
- ***« Verifiers are synthesized without access to the reference solution »***
- ***« it began to reason across multiple stages of exploitation, forming coherent plans for complete exploitation chains »***
- ***« Capability is growing fastest exactly where we are furthest behind »***
- ***« We will release the weights in two weeks after launch, once safety evaluation and hardening are complete »***
- ***« Disabling thinking is no longer supported »***

**Posición epistémica**: una parte interesada, transparente sobre su método, que juzga su propio rendimiento. Fiable en *cómo* se entrenó el modelo y *bajo qué condiciones* se midió; inverificable en *cuánto* vale realmente — la afirmación central se apoya en un benchmark privado y las puntuaciones de la competencia fueron producidas por Z.ai, con tres excepciones atribuidas (GDPval-AA v2 y FrontierSWE a **Artificial Analysis**, Toolathlon Verified mediante el servicio de evaluación oficial).

## Pense-betes

- **Fecha / fuente**: **14 de agosto de 2026**, blog oficial de **Z.ai**, publicación sin firma. Página construida como SPA de React, no capturable con un `curl | lynx` habitual; el nombre del bundle está hasheado, por lo que es inestable.
- **Encuadre clave**: mismo modelo base que GLM-5.2, todas las ganancias provienen del post-entrenamiento. El término *« emergent »* del título se refiere, en el cuerpo del texto, a una **tasa de progreso** — la capacidad en sí fue entrenada deliberadamente. ### La curva cibernética: la ganancia crece con la posición en la cadena | Benchmark | Qué mide | GLM-5.2 → GLM-5.3 | Factor | Mejor de la tabla | |---|---|---|---|---| | CyberGym | identificar y validar un fallo en caja blanca | 77,2 → **84,5%** | ×1,09 | **GLM-5.3** (por delante de 83,8 / 83,6) | | ExploitBench | razonar sobre la explotación de fallos reales | 24,4 → **54,4%** | **×2,2** | 78,0 (modelo cerrado) | | ExploitGym (2h) | tareas de explotación completadas, presupuesto normalizado | 29 → **105** | **×3,6** | 181 (modelo cerrado) | | ExploitGym (6h) | igual, 6h | 39 → **130** | ×3,3 | 247 (modelo cerrado) | Dos lecturas simultáneas, ambas exactas: Z.ai sigue muy por detrás de la frontera cerrada en todo lo relativo a la explotación real, y es precisamente ahí donde su progreso es más rápido — por un mes adicional de post-entrenamiento sobre el mismo modelo base. Trampa de citación: los presupuestos de ExploitGym están **normalizados por rendimiento**, reescalando el tiempo de API según el TPS de cada modelo (115 para GLM-5.3, 40 para Kimi K3, 47 para Qwen3.8-Max, según Artificial Analysis). No se trata de horas reales. ### El Security Disclosure Ledger | Contador | Valor | Proporción | |---|---|---| | Hallazgos rastreados | **2.436** | 100% | | Divulgados públicamente | **53** | **2,2%** | | Bajo embargo | **2.383** | **97,8%** | | Critical & High | 1.097 | 45% | | Proyectos OSS afectados | **269** | — | Un embargo entra dentro de la divulgación coordinada ordinaria; lo que llama la atención es el tamaño del backlog y la tasa de publicación. Cuatro puntos que la publicación no aborda: la política de plazos, la notificación efectiva a los mantenedores de los 269 proyectos, la identidad de los *« several security teams in China »* mencionados, y qué ocurre con el embargo una vez publicados los pesos — un modelo público capaz de redescubrir estos fallos vuelve el embargo, en la práctica, sin efecto. ### El calendario de publicación de los pesos *« We will release the weights in two weeks after launch, once safety evaluation and hardening are complete. »* Lo que no se especifica: la definición de *hardening* para pesos abiertos, los criterios que activarían un retraso, la existencia de un evaluador externo o red team designado, y ningún compromiso de publicar el informe. El calendario está anclado al lanzamiento comercial, no a la finalización de un proceso. Consecuencia práctica: a fecha del 14 de agosto de 2026, GLM-5.3 es un modelo de API acompañado de una intención de apertura, no integrado en una arquitectura de reversibilidad antes de la publicación efectiva. Comparar con el tratamiento de la publicación de pesos en [[zuckerberg-meta-future-is-for-everyone-superintelligence-2026-08-10]]. ### La afirmación "most capable open-weights model for coding" En los 7 benchmarks del grupo *Coding* donde **Kimi K3** aparece en la tabla de Z.ai: | Benchmark | GLM-5.3 | Kimi K3 | Ventaja | |---|---|---|---| | Terminal Bench 2.1 | 88,2 | **88,3** | Kimi K3 | | Terminal-Bench 3.0 | **28,3** | 17,4 | GLM-5.3 (amplia) | | DeepSWE (v1.1) | 66,9 | **67,5** | Kimi K3 | | NL2Repo | 58 | 58 | empate | | ProgramBench | **19** | 17,5 | GLM-5.3 | | SWE-Marathon (v1.1) | 42,5 | **48,1** | Kimi K3 (amplia) | | PostTrainBench | **39,8** | 32 | GLM-5.3 | Eso da **3-3 con un empate**. Sin embargo, dos afirmaciones más acotadas sí se sostienen: *« open-source SOTA on Terminal Bench 3.0 »* (28,3 frente a 17,4) y en *Agents' Last Exam* (28,5 frente a 27,6 para Kimi K3 y 27 para Qwen3.8-Max, a 0,1 punto del mejor modelo cerrado de la tabla). ### La ganancia de una generación de post-entrenamiento | Benchmark | GLM-5.2 | GLM-5.3 | Brecha | |---|---|---|---| | Terminal-Bench 3.0 | 4,6 | **28,3** | **×6,2** | | SWE-Marathon (v1.1) | 19,4 | **42,5** | ×2,2 | | DeepSWE (v1.1) | 46,2 | **66,9** | +20,7 pt | | AutomationBench | 26,2 | **48,2** | +22 pt | | Agents' Last Exam | 23,8 | **28,5** | +4,7 pt | | GDPval-AA v2 | 1508 | **1769** | +261 | Lectura: en tareas agénticas largas, el entorno de entrenamiento resulta ser una palanca más rentable que un nuevo preentrenamiento — *« much of the difficulty in scaling post-training moves from the model to the environment »*. Una brecha de ×6,2 en un solo mes también indica que el benchmark estaba lejos de saturarse: Terminal-Bench 3.0 sigue en 28,3%, es decir, más de siete tareas de cada diez fallan. Contexto sobre benchmarks agénticos: [[patel-block-buzz-teams-tokens-benchmarks-2026-08-06]]. ### Coste por tarea exitosa (Z.ai Code Bench, privado) | Configuración | Puntuación | Tokens de salida / tarea | |---|---|---| | GLM-5.2, esfuerzo Max | 23,4% | 96K | | **GLM-5.3, esfuerzo Max** | **34,5%** | **~75K** | | GLM-5.3, esfuerzo High | 31,4% | ~50K | | Claude Opus 4.8 (medición de Z.ai) | 29,5% | 120K | | Claude Fable 5, esfuerzo Max | **39,5%** | no divulgado | El argumento de venta es la proporción: +5 puntos respecto a Opus 4.8 con aproximadamente 1,6× menos tokens de salida. Tres matices que conviene mantener juntos: benchmark interno y privado, comparación autoadjudicada, y Fable 5 sigue por delante — Z.ai lo publica igualmente. El coste de los tokens de salida tampoco es el coste total (entrada, caché, número de turnos). ### La cadena de verificación, transponible fuera de Z.ai 1. Agentes de investigación recopilan patrones de tareas de trabajo real y los convierten en entornos ejecutables de largo horizonte, con dependencias multietapa y estado oculto. 2. Un **agente juez intenta cada tarea** para verificar que realmente es resoluble. 3. **Los verificadores se sintetizan sin acceso a la solución de referencia** — de modo que no pueden codificar la respuesta. 4. Las trayectorias del solucionador se usan para descubrir y cerrar atajos de recompensa. 5. Un verificador solo se admite si supera **oracle** (acepta la solución verdadera), **no-op** (rechaza no hacer nada) y **unsolved-state** (rechaza el estado inicial). Solo entonces *« produce a binary reward reliable enough to train on directly »*. Los puntos 3 y 5 se transponen a cualquier generación automática de pruebas: una prueba que no falla en rojo sobre el código original no prueba nada. Mismo requisito que el formulado en [[dumortier-marketing-ai-os-verification-2026-08-12]]. Limitación reconocida por Z.ai: *« These pipelines still require a meaningful amount of human-in-the-loop work. »* ### Claude Code como arnés de evaluación Siete evaluaciones documentadas en las notas al pie se realizan *« in Claude Code 2.1.207 »* — Terminal-Bench 2.1 y 3.0, ALE, CyberGym, ExploitGym, ExploitBench, PostTrainBench, SWE-Marathon. Un laboratorio chino mide allí su modelo de frontera y los de sus competidores, citando la versión como una dependencia. Corolario no contabilizado: la transferibilidad de los resultados a otro arnés. ### Ruptura de API y precios
- *« Disabling thinking is no longer supported by GLM-5.3 »*: `thinking.type: "disabled"` provoca el fallo de la solicitud. Migración prescrita: cambiar a `enabled` **y** `reasoning_effort: "low"` **antes** de cambiar el ID del modelo. Tres niveles `low` / `high` / `max`, **por defecto `max`**. El coste mínimo de una llamada aumenta, por tanto; para cualquier carga de trabajo de alto volumen y baja complejidad, el cambio a `low` debe preceder al cambio de ID.
- **GLM Coding Plan** usa cuotas por puntos, contabilizadas por separado para entrada, entrada en caché y salida. **Horas punta de 14:00 a 18:00 UTC+8, de lunes a viernes**, el resto del tiempo al 50% de la tarifa — lo que, para un equipo europeo, supone una franja punta correspondiente a 08:00-12:00 hora de París. Oferta ZCode asociada: reivindica una *« 98%+ cache hit rate »*, ~30% más de tokens efectivos, un impulso de cuota de 1,5× hasta el **31 de agosto de 2026**, modo *Goal* y *Remote Control* vía **WeChat o Feishu**. ### Tres incoherencias internas, que no deben propagarse 1. *« 1,097 medium-to-high severity issues »* contradice la propia barra lateral de la misma publicación: critical 107 + high 990 = **1.097**, medium 1.286 aparte. Citar como **"1.097 fallos críticos o de severidad alta"**. 2. *« the oldest dating back roughly 40 years »* contradice la barra lateral (*« introduced in 1981 »*, *« 45 YEARS OF IMPACT »*). Usar **1981** y una vida media de **26,6 años**. 3. El cuerpo del texto atribuye a **"Mythos 5"** las puntuaciones de 83,8 / 78,0 / 181-247 que la tabla atribuye a **"Fable 5 (w/ fallback)"**. Son dos modelos de Anthropic distintos y la publicación no resuelve cuál es. No atribuir estas puntuaciones a un modelo nombrado. ### Infraestructura de entrenamiento Post-entrenamiento sobre **slime** (framework de código abierto de Z.ai), **Megatron** para el entrenamiento, **SGLang** para el rollout, con entrenamiento, rollout y buffer en un único flujo de datos — los entornos se conectan como generación de datos, no como modificaciones del bucle. Ganancias reivindicadas: brecha media de log-probabilidad entre entrenamiento y rollout controlada a **1e-7**, **multi-teacher OPD** con conmutación dinámica y prefetching, programación conjunta router/slime, para un total de **más de 2,3× de rendimiento de extremo a extremo** en tareas de RL de codificación de largo horizonte. Publicaciones subyacentes: **IndexShare** (arXiv 2603.12201) y **SAO** (arXiv 2607.07508). ### Higiene de la citación
- Todo lo procedente de **Z.ai Code Bench** es inverificable por construcción: citarlo como *« per an unpublished internal benchmark »*.
- Todas las puntuaciones de la competencia en la tabla fueron producidas por Z.ai, salvo GDPval-AA v2 y FrontierSWE (Artificial Analysis) y Toolathlon Verified (servicio oficial).
- Los arneses públicos fueron modificados; las puntuaciones no son comparables con las clasificaciones oficiales.
- El vínculo con el expediente de soberanía es directo: tres días antes, [[nunez-mistral-gigawatt-compute-europeen-venturebeat-2026-08-11]] anunciaba que Mistral AI aloja GLM-5.2 bajo controles regionales europeos. Las evaluaciones de seguridad que Mistral dice aplicar a modelos de terceros no han sido descritas públicamente.

## RésuméDe400mots

Publicación de anuncio publicada el **14 de agosto de 2026** en el blog de **Z.ai** (antes Zhipu AI), **sin firma**, con motivo del lanzamiento de **GLM-5.3**.

**La tesis metodológica.** *« Scaling post-training is all we did for GLM-5.3. »* Mismo modelo base que GLM-5.2: **toda la ganancia proviene del post-entrenamiento**, construido sobre la pila del ciclo anterior — **IndexShare** (contexto largo), **SAO** (RL de largo horizonte) y **slime** (entrenamiento asíncrono, Megatron + SGLang). El cuello de botella se ha desplazado del modelo **al entorno**: Z.ai describe pipelines que **sintetizan** entornos y señal de recompensa — un agente juez verifica la resolubilidad, **los verificadores se sintetizan sin acceso a la solución de referencia**, y solo se admiten tras un tríptico de controles **oracle / no-op / unsolved-state**. El trabajo sigue siendo *« human-in-the-loop »*. El rendimiento de RL de extremo a extremo mejoró **más de 2,3×**.

**Los resultados de codificación.** Terminal-Bench 3.0 pasa de **4,6 a 28,3**, DeepSWE v1.1 de **46,2 a 66,9**, Agents' Last Exam de **23,8 a 28,5**. En **Z.ai Code Bench**, un benchmark **interno y privado**, +50% respecto a GLM-5.2, con una ganancia simultánea en **eficiencia de tokens**: 34,5% con ~75K tokens de salida en esfuerzo Max (frente a 23,4% con 96K para GLM-5.2), y 31,4% con ~50K en esfuerzo High — por delante de Claude Opus 4.8 (29,5% con 120K). **Claude Fable 5 se mantiene por delante con 39,5%.** La afirmación *« most capable open-weights model for coding »* **no se desprende de la tabla**: frente a **Kimi K3**, el resultado es **3-3 con un empate**.

**La capacidad cibernética.** Presentada como *« emergente »*, fue **entrenada deliberadamente** — la publicación escribe *« we expected this to make the model better »*. Lo que resultó sorprendente fue la **velocidad**, y el paso de fallos aislados a la **cadena de explotación completa**. CyberGym **84,5%** (el mejor de la tabla), ExploitBench **54,4%** (×2,2), ExploitGym **105/130 tareas** (×3,6 respecto a GLM-5.2, presupuestos normalizados por rendimiento). Frase clave: ***« Capability is growing fastest exactly where we are furthest behind. »***

**La cifra más pesada.** Trabajando con equipos de seguridad chinos, el modelo identificó **2.436 vulnerabilidades en 269 proyectos de código abierto** — núcleos, sistemas operativos, motores de navegador, protocolos de red — la más antigua introducida en **1981**, vida media de **26,6 años**. El **Security Disclosure Ledger** muestra **53 divulgadas** y **2.383 bajo embargo**: **2,2% publicado**.

**Gobernanza.** Publicación de los pesos anunciada *« in two weeks, once safety evaluation and hardening are complete »* — **una fecha, no un criterio**: sin definición de hardening, sin condición de no publicación, sin evaluador externo.

**Varios.** `thinking.type: "disabled"` **ya no está soportado** (se requiere migración); las cuotas del GLM Coding Plan son por puntos, **50% fuera de la franja 14:00-18:00 UTC+8**; **casi todas las evaluaciones se realizan en Claude Code 2.1.207**.

## GrapheDeConnaissance

- Z.ai —publie→ GLM-5.3 (TECHNOLOGIE, 0.98)
- GLM-5.3 —est_variante_de→ GLM (TECHNOLOGIE, 0.97)
- Z.ai —publie→ GLM (TECHNOLOGIE, 0.98)
- GLM-5.3 —remplace→ GLM-5.2 (TECHNOLOGIE, 0.97)
- GLM-5.3 —est_basé_sur→ GLM-5.2 (TECHNOLOGIE, 0.96)
- Z.ai —affirme_que→ GLM-5.3 utilise le même modèle de base que GLM-5.2 et que la totalité du gain provient du post-entraînement — « Scaling post-training is all we did » (CITATION, 0.97)
- GLM-5.3 —utilise→ slime (TECHNOLOGIE, 0.95)
- slime —permet→ de brancher maths, code, sandboxes, vérificateurs et environnements agentiques long-horizon comme de la génération de données plutôt que comme des modifications de la boucle d'entraînement, entraînement, rollout et buffer tenant sur un seul flux de données (AFFIRMATION, 0.93)
- slime —améliore→ le débit d'entraînement RL end-to-end de plus de 2,3× sur les tâches de codage long-horizon, avec un écart moyen de log-probabilités entraînement-rollout contrôlé à 1e-7 (MESURE, 0.9)
- GLM-5.3 —utilise→ SAO (METHODOLOGIE, 0.92)
- GLM-5.3 —utilise→ IndexShare (TECHNOLOGIE, 0.9)
- Z.ai —affirme_que→ la difficulté du passage à l'échelle du post-entraînement se déplace du modèle vers l'environnement, un environnement utile devant être exécutable, vérifiable et proche du travail professionnel réel, et devant exister en grand nombre (AFFIRMATION, 0.95)
- synthèse d'environnements de tâches —permet→ de produire des environnements long-horizon exécutables et leur signal de récompense à partir de motifs collectés sur du travail réel, un agent juge vérifiant au préalable que chaque tâche est effectivement résoluble (AFFIRMATION, 0.93)
- synthèse d'environnements de tâches —recommande→ de synthétiser les vérificateurs sans accès à la solution de référence et de ne les admettre qu'après trois contrôles négatifs — oracle, no-op et unsolved-state — afin d'obtenir une récompense binaire assez fiable pour entraîner directement dessus (AFFIRMATION, 0.94)
- synthèse d'environnements de tâches —réduit→ les raccourcis de récompense, les trajectoires de solveur servant à les découvrir puis à les fermer (AFFIRMATION, 0.9)
- GLM-5.3 —mesure→ 28,3 sur Terminal-Bench 3.0 contre 4,6 pour GLM-5.2, 66,9 sur DeepSWE v1.1 contre 46,2, et 28,5 sur Agents' Last Exam contre 23,8 (MESURE, 0.96)
- Z.ai —a_créé→ Z.ai Code Bench (TECHNOLOGIE, 0.95)
- Z.ai Code Bench —réduit→ le risque de contamination par les jeux de test publics, au prix de l'impossibilité pour un tiers de répliquer la mesure (AFFIRMATION, 0.88)
- GLM-5.3 —mesure→ 34,5 % sur Z.ai Code Bench à environ 75 000 tokens de sortie par tâche en effort Max, contre 23,4 % à 96 000 pour GLM-5.2, et 31,4 % à environ 50 000 tokens en effort High (MESURE, 0.93)
- GLM-5.3 —surpasse→ Claude Opus 4.8 (TECHNOLOGIE, 0.85)
- Z.ai —affirme_que→ GLM-5.3 est le modèle à poids ouverts le plus capable pour le codage, revendication que son propre tableau ne départage pas face à Kimi K3, à égalité sur les benchmarks de codage renseignés pour les deux (AFFIRMATION, 0.86)
- GLM-5.3 —concurrence→ Kimi K3 (TECHNOLOGIE, 0.92)
- Z.ai —affirme_que→ la capacité cyber s'est développée plus vite qu'attendu alors que les données et environnements de découverte de vulnérabilités avaient été délibérément introduits dans le mélange d'entraînement, le résultat visé étant précisément d'améliorer le modèle sur ce terrain (AFFIRMATION, 0.95)
- GLM-5.3 —permet→ de raisonner à travers plusieurs étapes d'exploitation et de former des plans cohérents pour des chaînes d'exploitation complètes, au lieu d'identifier des failles isolées (AFFIRMATION, 0.93)
- GLM-5.3 —mesure→ 84,5 % sur CyberGym contre 77,2 % pour GLM-5.2, 54,4 % sur ExploitBench contre 24,4 %, et 105 puis 130 tâches ExploitGym sous budgets normalisés de 2 h et 6 h contre 29 et 39 (MESURE, 0.95)
- Z.ai —affirme_que→ plus un benchmark se situe haut dans la chaîne d'exploitation, plus le gain sur GLM-5.2 est grand et plus l'écart au frontier fermé reste large — « Capability is growing fastest exactly where we are furthest behind » (CITATION, 0.96)
- GLM-5.3 —observé_dans→ 2 436 vulnérabilités identifiées dans 269 projets open source après revue d'experts, tri et déduplication, couvrant noyaux système, systèmes d'exploitation, moteurs de navigateur, infrastructure open source, applications web et protocoles réseau (MESURE, 0.93)
- Z.ai —a_créé→ Z.ai Security Disclosure Ledger (TECHNOLOGIE, 0.94)
- Z.ai Security Disclosure Ledger —mesure→ 2 436 constats suivis dont 53 publiquement divulgués et 2 383 sous embargo, 1 097 de sévérité critique ou élevée, la plus ancienne faille introduite en 1981 et une durée de vie moyenne de 26,6 ans avant découverte (MESURE, 0.94)
- Z.ai —collabore_avec→ plusieurs équipes de sécurité en Chine, non nommées, pour exécuter les modèles GLM contre des bases de code réelles depuis GLM-5.2 (AFFIRMATION, 0.9)
- Z.ai —prédit→ la publication des poids de GLM-5.3 dans les deux semaines suivant le lancement, une fois l'évaluation de sûreté et le durcissement terminés (AFFIRMATION, 0.95)
- publication de poids ouverts —s_applique_à→ un calendrier annoncé plutôt qu'à une procédure publiée : ni définition du durcissement, ni critère de non-publication, ni évaluateur tiers ne sont fournis (AFFIRMATION, 0.88)
- GLM-5.3 —observé_dans→ Claude Code (TECHNOLOGIE, 0.94)
- Claude Code —est_instance_de→ harnais d'évaluation agentique de référence, utilisé en version 2.1.207 par un laboratoire concurrent pour mesurer son propre modèle et ceux d'Anthropic et d'OpenAI (AFFIRMATION, 0.89)
- Artificial Analysis —mesure→ les scores GDPval-AA v2 et FrontierSWE du tableau comparatif, seules évaluations attribuées à un tiers, ainsi que les débits par modèle servant à normaliser les budgets ExploitGym (MESURE, 0.92)
- GLM-5.3 —s_oppose_à→ la désactivation du raisonnement : thinking.type « disabled » n'est plus supporté et fait échouer la requête, trois niveaux low, high et max étant proposés avec max par défaut (AFFIRMATION, 0.95)
- GLM Coding Plan —utilise→ un système de quotas en points comptés séparément pour l'entrée, l'entrée en cache et la sortie, les appels hors heures pleines — hors 14h-18h UTC+8 du lundi au vendredi — consommant 50 % du barème (AFFIRMATION, 0.93)
- ZCode —permet→ un taux de cache revendiqué à plus de 98 %, un mode Goal qui planifie, code, teste et vérifie jusqu'à atteinte de la cible, et un pilotage à distance des tâches longues via WeChat ou Feishu (AFFIRMATION, 0.9)

---
Canonical: https://www.thekb.eu/es/fiches/zai-glm-53-emergent-cyber-2026-08-14/
