Vai al contenuto

root / tags / zhipu-ai

#Zhipu AI

2 fiches

Qualità e Sicurezza Traduzione verificata automaticamente

GLM-5.3: Frontier Coding with Emergent Cyber Capabilities

Post di annuncio pubblicato sul **blog ufficiale di Z.ai** (già Zhipu AI, laboratorio cinese) il **14 agosto 2026**, **senza firma individuale**, ~2.000 parole più note a piè di pagina. Annuncia **GLM-5.3**, successore di GLM-5.2, aprendo con una tesi metodologica: *« Scaling post-training is all we did for GLM-5.3. »* Stesso modello di base di GLM-5.2 — *« every gain comes from post-training »*. Tre annunci. **(A) Un modello di coding open-weights**: +50% dichiarato sul **Z.ai Code Bench**, un benchmark interno non pubblicato. **(B) Una capacità cyber presentata come "emergente"**, che il corpo del testo riconduce a una scelta di addestramento — *« As part of post-training, we introduced vulnerability discovery data and environments into the training mix. We expected this to make the model better at finding and reasoning about vulnerabilities »* — ciò che è arrivato come sorpresa è la velocità e il cambiamento di natura: il modello passa dall'identificazione di falle isolate a *« coherent plans for complete exploitation chains »*. I guadagni crescono con la posizione nella catena di exploitation: CyberGym 77,2 → **84,5%**, ExploitBench 24,4 → **54,4%** (×2,2), ExploitGym 29 → **105** task in 2h (×3,6), con il divario rispetto alla frontiera chiusa che resta ampio (181 e 247 task). Z.ai lo formula così: *« Capability is growing fastest exactly where we are furthest behind. »* Il post pubblica anche un **Z.ai Security Disclosure Ledger**: **2.436 vulnerabilità identificate in 269 progetti open source** — kernel, sistemi operativi, motori browser, infrastrutture, applicazioni web, protocolli di rete — la più vecchia introdotta nel **1981**, durata media prima della scoperta **26,6 anni**, di cui **53 divulgate** e **2.383 sotto embargo**. **(C) Un rilascio dei pesi** *« within two weeks of launch, once safety evaluation and hardening are complete »*. Il contributo metodologico più riutilizzabile: **sintesi di ambiente e verificatore**, quest'ultimo prodotto senza accesso alla soluzione di riferimento e ammesso solo dopo un tris di controlli negativi — **oracle**, **no-op**, **unsolved-state**. Tutte le valutazioni agentiche sono condotte **in Claude Code 2.1.207**.

#GLM-5.3#GLM-5.2#Z.ai

**Z.ai** (anciennement **Zhipu AI**) · laboratoire d'IA chinois · éditeur de la famille **GLM**. Billet **institutionnel et non signé** : aucun auteur nommé · aucun chercheur mis en avant · aucun lien vers un rapport technique ou une carte de modèle. Publié le **14 août 2026**. La page est une SPA React — le HTML servi est un `<div id="root">` vide · et le texte comme les scores ont dû être extraits du bundle `glm-5.3-BCnx8T5_.js` · où ils figurent en valeurs source.

Economia e Mercato Traduzione verificata automaticamente

GLM-5.2 leads open weights models and sits at #3 overall on GDPval-AA, a real-world agentic work benchmark

Annuncio di benchmark da **Artificial Analysis** (piattaforma indipendente di valutazione di modelli AI, via X/Twitter + pagina del modello): **GLM-5.2** di **Z.ai** (Zhipu AI, @Zai_org) diventa **il modello open weights leader** e sale al **#3 posto nella classifica generale** di **GDPval-AA**, un benchmark basato su casi reali per il *lavoro intellettuale economicamente rilevante* (compiti agentic, multi-turno, a lungo orizzonte). GLM-5.2 ottiene **1524 Elo**, dietro solo a **Claude Fable 5 (1783)** e **Claude Opus 4.8 (1615)**, e alla pari con **GPT-5.5 (xhigh, 1509)**. Precede con largo margine il miglior modello open successivo (**MiniMax-M3, 1408**), insieme a numerosi modelli proprietari: **Gemini 3.5 Flash (1357)**, **Qwen 3.7 Max (1289)**, **Muse Spark (1158)**. I compiti sono autenticamente agentic: **~31 turni per compito** in media su **1.999 confronti**. La stessa classifica si conferma sull'**Artificial Analysis Intelligence Index** (1° tra i modelli open weights), sull'**Agentic Index** (#3) e su **AA-Briefcase** (#3, davanti a GPT-5.5 xhigh, dietro solo a Fable 5). Da segnalare: un modello **open weights** con licenza **MIT**, **MoE con 753 miliardi di parametri / 40 miliardi attivi**, **contesto di 1M token**, con un prezzo di **1,40$/4,40$ per 1M di token** in input/output, che rivaleggia con la frontiera proprietaria sul lavoro agentic — un vero passo avanti per i modelli open.

#GLM-5.2#Z.ai#Zhipu AI

Artificial Analysis (@ArtificialAnlys)