Aller au contenu
Organisation

Artificial Analysis

Artificial Analysis — Organisation. rôle : Seul tiers évaluateur cité dans le billet : produit les scores GDPval-AA v2 et FrontierSWE du tableau comparatif, et fournit les débits par modèle qui servent à normaliser les budgets temps d'ExploitGym

Artificial Analysis a publié le 22 juin 2026 une comparaison plaçant GLM-5.2 de Z.ai à 1524 Elo sur GDPval-AA, troisième au classement général et premier parmi les modèles à poids ouverts, derrière Claude Fable 5 (1783) et Claude Opus 4.8 (1615), et à égalité avec GPT-5.5 dans son réglage xhigh (1509). L'écart au sein du camp ouvert était large : MiniMax-M3, le modèle ouvert suivant, obtenait 1408.

C'est la méthode qui rend ce chiffre lisible. GDPval-AA note des tâches à horizon long, multi-tours, rédigées comme des exercices professionnels (la liste de tâches quotidiennes d'un chef de rayon, un document technique IEC). Artificial Analysis a soumis des briefs identiques à GLM-5.2 et à trois modèles frontière propriétaires, puis restitué chaque livrable tel quel. GLM-5.2 a compté en moyenne environ 31 tours par tâche sur 1 999 confrontations. Le verdict d'Artificial Analysis sur ce résultat : un modèle à poids ouverts à ce prix, capable de rivaliser avec la frontière propriétaire sur un travail agentique réellement utile, constitue « a real step for open models ».

Deux mois plus tard, dans l'annonce non signée de GLM-5.3 par Z.ai du 14 août 2026, Artificial Analysis est le seul évaluateur extérieur présent. Les chiffres GDPval-AA v2 et FrontierSWE du tableau comparatif sont les seuls scores attribués à un tiers, et ce sont ses chiffres de débit par modèle qui servent à normaliser les budgets de temps pour ExploitGym. Le reste, y compris les résultats du Z.ai Code Bench qui portent l'affirmation « most capable open-weights model for coding », est produit en interne et n'est pas rendu public. Il ne reste donc qu'un seul point d'ancrage extérieur pour tenir la crédibilité d'une publication dont Z.ai qualifie lui-même les résultats en cybersécurité d'émergents.

Type
Organisation
rôle
Seul tiers évaluateur cité dans le billet : produit les scores GDPval-AA v2 et FrontierSWE du tableau comparatif, et fournit les débits par modèle qui servent à normaliser les budgets temps d'ExploitGym
relations
3
Citée dans
2 fiches

Voisinage

GDPval-AA

→ publie

GDPval-AA DOCUMENT confiance élevée stable Source ↗

Citée dans (2)