Artificial Analysis — una piattaforma indipendente di valutazione di modelli AI — pubblica (thread X/Twitter del 22 giugno 2026 + una pagina dettagliata del modello) un confronto che colloca GLM-5.2, l'ultimo modello di Z.ai (Zhipu AI), in cima ai modelli open weights e al #3 posto nella classifica generale di GDPval-AA. Questo benchmark misura le prestazioni su lavoro intellettuale reale ed economicamente rilevante, attraverso compiti multi-turno a lungo orizzonte concepiti come esercizi professionali autentici (per esempio l'elenco dei compiti giornalieri di un supervisore di negozio al dettaglio, o un documento tecnico IEC) che coprono sia il lavoro professionale sia quello creativo.
GLM-5.2 raggiunge 1524 Elo, dietro solo a Claude Fable 5 (1783) e Claude Opus 4.8 (1615), e alla pari con GPT-5.5 in configurazione xhigh (1509). Soprattutto, domina il campo open con un ampio margine: il miglior modello open successivo, MiniMax-M3, ottiene solo 1408. GLM-5.2 supera anche diversi modelli proprietari — Gemini 3.5 Flash (1357), Qwen 3.7 Max (1289) e Muse Spark (1158).
Viene sottolineata la natura agentic dei compiti: GLM-5.2 ha registrato in media ~31 turni per compito su 1.999 confronti. Il metodo di Artificial Analysis consiste nel fornire brief identici a GLM-5.2 e a tre modelli proprietari di frontiera (Fable 5, GPT-5.5, Gemini 3.5 Flash), per poi rendere ogni output esattamente come prodotto. Il risultato è coerente su tutti gli indici della società: GLM-5.2 è #1 tra i modelli open weights sull'Intelligence Index, #3 sull'Agentic Index e #3 su AA-Briefcase (dove è il miglior modello open, davanti a GPT-5.5 xhigh e dietro solo a Fable 5).
La pagina del modello completa il quadro: GLM-5.2 è una Mixture of Experts con 753 miliardi di parametri (di cui 40 miliardi attivi), un modello di reasoning con contesto di 1M token, distribuito con licenza MIT (uso commerciale, pesi su Hugging Face), rilasciato il 16 giugno 2026. Sul piano economico: 1,40$ / 4,40$ per milione di token (input/output), un cache hit a 0,26$ (-81%), un throughput di 106,3 token/s e un time to first token di 1,36 s.
Il messaggio trasmesso dai numeri è chiaro: che un modello open weights a questo livello di prezzo rivaleggi con la frontiera proprietaria su un lavoro agentic realmente utile costituisce, secondo Artificial Analysis, "un vero passo avanti per i modelli open". La convergenza tra modelli open e proprietari non si gioca più solo sui test accademici, ma sul valore economico prodotto in condizioni agentic.