Vai al contenuto
Organizzazione

Artificial Analysis

Artificial Analysis — Organizzazione. ruolo: Unico terzo valutatore citato nel post: produce i punteggi GDPval-AA v2 e FrontierSWE della tabella comparativa, e fornisce i throughput per modello usati per normalizzare i budget temporali di ExploitGym

Artificial Analysis ha pubblicato il 22 giugno 2026 un confronto che colloca GLM-5.2 di Z.ai a 1524 Elo su GDPval-AA, terzo assoluto e primo tra i modelli open weights, dietro Claude Fable 5 (1783) e Claude Opus 4.8 (1615) e alla pari con GPT-5.5 nella sua configurazione xhigh (1509). Il distacco all'interno del campo open era ampio: MiniMax-M3, il modello open successivo in classifica, ha ottenuto 1408.

È il metodo a rendere leggibile il dato. GDPval-AA valuta compiti multi-turno a lungo orizzonte, scritti come esercizi professionali (la lista di compiti giornalieri di un supervisore di negozio, un documento tecnico IEC). Artificial Analysis ha assegnato gli stessi brief a GLM-5.2 e a tre modelli proprietari di frontiera, restituendo poi ogni deliverable esattamente come prodotto. GLM-5.2 ha registrato in media circa 31 turni per compito su 1.999 confronti. Il giudizio che Artificial Analysis ha associato al risultato: un modello open weights a quel prezzo che compete con la frontiera proprietaria su lavoro agentico realmente utile rappresenta "a real step for open models".

Due mesi dopo, nell'annuncio non firmato di GLM-5.3 diffuso da Z.ai il 14 agosto 2026, Artificial Analysis è l'unico valutatore esterno presente. I dati di GDPval-AA v2 e FrontierSWE nella tabella comparativa sono gli unici punteggi attribuiti a una terza parte, e i suoi numeri di throughput per modello sono ciò che normalizza i budget di tempo per ExploitGym. Il resto, inclusi i risultati di Z.ai Code Bench che sostengono l'affermazione "most capable open-weights model for coding", è interno e non verificabile esternamente. Resta quindi un solo ancoraggio esterno a sostenere la credibilità di un annuncio i cui risultati sul fronte cyber Z.ai stessa definisce emergenti.

Tipo
Organizzazione
ruolo
Unico terzo valutatore citato nel post: produce i punteggi GDPval-AA v2 e FrontierSWE della tabella comparativa, e fornisce i throughput per modello usati per normalizzare i budget temporali di ExploitGym
relazioni
3
Citata in
2 fiches

Vicinato

GDPval-AA

→ pubblica

GDPval-AA DOCUMENT affidabilità alta stabile Fonte ↗

Citata in (2)