- thekb.eu
- Grafo di conoscenza
- Organizzazione
- Artificial Analysis
Artificial Analysis
Artificial Analysis — Organizzazione. ruolo: Unico terzo valutatore citato nel post: produce i punteggi GDPval-AA v2 e FrontierSWE della tabella comparativa, e fornisce i throughput per modello usati per normalizzare i budget temporali di ExploitGym
Artificial Analysis ha pubblicato il 22 giugno 2026 un confronto che colloca GLM-5.2 di Z.ai a 1524 Elo su GDPval-AA, terzo assoluto e primo tra i modelli open weights, dietro Claude Fable 5 (1783) e Claude Opus 4.8 (1615) e alla pari con GPT-5.5 nella sua configurazione xhigh (1509). Il distacco all'interno del campo open era ampio: MiniMax-M3, il modello open successivo in classifica, ha ottenuto 1408.
È il metodo a rendere leggibile il dato. GDPval-AA valuta compiti multi-turno a lungo orizzonte, scritti come esercizi professionali (la lista di compiti giornalieri di un supervisore di negozio, un documento tecnico IEC). Artificial Analysis ha assegnato gli stessi brief a GLM-5.2 e a tre modelli proprietari di frontiera, restituendo poi ogni deliverable esattamente come prodotto. GLM-5.2 ha registrato in media circa 31 turni per compito su 1.999 confronti. Il giudizio che Artificial Analysis ha associato al risultato: un modello open weights a quel prezzo che compete con la frontiera proprietaria su lavoro agentico realmente utile rappresenta "a real step for open models".
Due mesi dopo, nell'annuncio non firmato di GLM-5.3 diffuso da Z.ai il 14 agosto 2026, Artificial Analysis è l'unico valutatore esterno presente. I dati di GDPval-AA v2 e FrontierSWE nella tabella comparativa sono gli unici punteggi attribuiti a una terza parte, e i suoi numeri di throughput per modello sono ciò che normalizza i budget di tempo per ExploitGym. Il resto, inclusi i risultati di Z.ai Code Bench che sostengono l'affermazione "most capable open-weights model for coding", è interno e non verificabile esternamente. Resta quindi un solo ancoraggio esterno a sostenere la credibilità di un annuncio i cui risultati sul fronte cyber Z.ai stessa definisce emergenti.
- Tipo
- Organizzazione
- ruolo
- Unico terzo valutatore citato nel post: produce i punteggi GDPval-AA v2 e FrontierSWE della tabella comparativa, e fornisce i throughput per modello usati per normalizzare i budget temporali di ExploitGym
- relazioni
- 3
- Citata in
- 2 fiches
Vicinato
→ pubblica