Publicación de anuncio publicada el 14 de agosto de 2026 en el blog de Z.ai (antes Zhipu AI), sin firma, con motivo del lanzamiento de GLM-5.3.
La tesis metodológica. « Scaling post-training is all we did for GLM-5.3. » Mismo modelo base que GLM-5.2: toda la ganancia proviene del post-entrenamiento, construido sobre la pila del ciclo anterior — IndexShare (contexto largo), SAO (RL de largo horizonte) y slime (entrenamiento asíncrono, Megatron + SGLang). El cuello de botella se ha desplazado del modelo al entorno: Z.ai describe pipelines que sintetizan entornos y señal de recompensa — un agente juez verifica la resolubilidad, los verificadores se sintetizan sin acceso a la solución de referencia, y solo se admiten tras un tríptico de controles oracle / no-op / unsolved-state. El trabajo sigue siendo « human-in-the-loop ». El rendimiento de RL de extremo a extremo mejoró más de 2,3×.
As part of post-training, we introduced vulnerability discovery data and environments into the training mix. We expected this to make the model better at finding and reasoning about vulnerabilities
Los resultados de codificación. Terminal-Bench 3.0 pasa de 4,6 a 28,3, DeepSWE v1.1 de 46,2 a 66,9, Agents' Last Exam de 23,8 a 28,5. En Z.ai Code Bench, un benchmark interno y privado, +50% respecto a GLM-5.2, con una ganancia simultánea en eficiencia de tokens: 34,5% con ~75K tokens de salida en esfuerzo Max (frente a 23,4% con 96K para GLM-5.2), y 31,4% con ~50K en esfuerzo High — por delante de Claude Opus 4.8 (29,5% con 120K). Claude Fable 5 se mantiene por delante con 39,5%. La afirmación « most capable open-weights model for coding » no se desprende de la tabla: frente a Kimi K3, el resultado es 3-3 con un empate.
La capacidad cibernética. Presentada como « emergente », fue entrenada deliberadamente — la publicación escribe « we expected this to make the model better ». Lo que resultó sorprendente fue la velocidad, y el paso de fallos aislados a la cadena de explotación completa. CyberGym 84,5% (el mejor de la tabla), ExploitBench 54,4% (×2,2), ExploitGym 105/130 tareas (×3,6 respecto a GLM-5.2, presupuestos normalizados por rendimiento). Frase clave: « Capability is growing fastest exactly where we are furthest behind. »
La cifra más pesada. Trabajando con equipos de seguridad chinos, el modelo identificó 2.436 vulnerabilidades en 269 proyectos de código abierto — núcleos, sistemas operativos, motores de navegador, protocolos de red — la más antigua introducida en 1981, vida media de 26,6 años. El Security Disclosure Ledger muestra 53 divulgadas y 2.383 bajo embargo: 2,2% publicado.
Gobernanza. Publicación de los pesos anunciada « in two weeks, once safety evaluation and hardening are complete » — una fecha, no un criterio: sin definición de hardening, sin condición de no publicación, sin evaluador externo.
Varios. thinking.type: "disabled" ya no está soportado (se requiere migración); las cuotas del GLM Coding Plan son por puntos, 50% fuera de la franja 14:00-18:00 UTC+8; casi todas las evaluaciones se realizan en Claude Code 2.1.207.