Saltar al contenido
Organización

Artificial Analysis

Artificial Analysis — Organización. rol: Único tercero evaluador citado en la publicación: produce las puntuaciones GDPval-AA v2 y FrontierSWE de la tabla comparativa, y aporta los caudales por modelo que sirven para normalizar los presupuestos de tiempo de ExploitGym

Artificial Analysis publicó una comparativa el 22 de junio de 2026 que situó a GLM-5.2 de Z.ai en 1524 Elo en GDPval-AA, tercero en el conjunto y primero entre los modelos de pesos abiertos, por detrás de Claude Fable 5 (1783) y Claude Opus 4.8 (1615), y a la par de GPT-5.5 en su configuración xhigh (1509). El margen dentro del campo abierto era amplio: MiniMax-M3, el siguiente modelo abierto, obtuvo 1408.

El método es lo que hace legible la cifra. GDPval-AA puntúa tareas de largo horizonte y múltiples turnos redactadas como ejercicios profesionales (la lista de tareas diarias de un supervisor de tienda, un documento técnico de la IEC). Artificial Analysis dio los mismos encargos a GLM-5.2 y a otros tres modelos de vanguardia propietarios, y luego mostró cada entregable exactamente como fue producido. GLM-5.2 promedió unos 31 turnos por tarea a lo largo de 1.999 partidas. El veredicto que Artificial Analysis asoció al resultado: un modelo de pesos abiertos que a ese precio compite con la vanguardia propietaria en trabajo agéntico genuinamente útil es "a real step for open models".

Dos meses después, en el anuncio no firmado de GLM-5.3 de Z.ai del 14 de agosto de 2026, Artificial Analysis es el único evaluador externo presente. Las cifras de GDPval-AA v2 y FrontierSWE en la tabla comparativa son las únicas puntuaciones atribuidas a un tercero, y sus cifras de rendimiento por modelo son las que normalizan los presupuestos de tiempo para ExploitGym. El resto, incluidos los resultados de Z.ai Code Bench que sustentan la afirmación de "most capable open-weights model for coding", es interno y privado. Eso deja un único anclaje externo sosteniendo la credibilidad de un lanzamiento cuyos propios resultados de ciberseguridad Z.ai califica de emergentes.

Tipo
Organización
rol
Único tercero evaluador citado en la publicación: produce las puntuaciones GDPval-AA v2 y FrontierSWE de la tabla comparativa, y aporta los caudales por modelo que sirven para normalizar los presupuestos de tiempo de ExploitGym
relaciones
3
Citada en
2 fiches

Vecindario

GDPval-AA

→ publica

GDPval-AA DOCUMENT confianza alta estable Fuente ↗

Citada en (2)