Vai al contenuto

root / tags / exploitgym

#ExploitGym

2 fiches

Qualità e Sicurezza Traduzione verificata automaticamente

GLM-5.3: Frontier Coding with Emergent Cyber Capabilities

Post di annuncio pubblicato sul **blog ufficiale di Z.ai** (già Zhipu AI, laboratorio cinese) il **14 agosto 2026**, **senza firma individuale**, ~2.000 parole più note a piè di pagina. Annuncia **GLM-5.3**, successore di GLM-5.2, aprendo con una tesi metodologica: *« Scaling post-training is all we did for GLM-5.3. »* Stesso modello di base di GLM-5.2 — *« every gain comes from post-training »*. Tre annunci. **(A) Un modello di coding open-weights**: +50% dichiarato sul **Z.ai Code Bench**, un benchmark interno non pubblicato. **(B) Una capacità cyber presentata come "emergente"**, che il corpo del testo riconduce a una scelta di addestramento — *« As part of post-training, we introduced vulnerability discovery data and environments into the training mix. We expected this to make the model better at finding and reasoning about vulnerabilities »* — ciò che è arrivato come sorpresa è la velocità e il cambiamento di natura: il modello passa dall'identificazione di falle isolate a *« coherent plans for complete exploitation chains »*. I guadagni crescono con la posizione nella catena di exploitation: CyberGym 77,2 → **84,5%**, ExploitBench 24,4 → **54,4%** (×2,2), ExploitGym 29 → **105** task in 2h (×3,6), con il divario rispetto alla frontiera chiusa che resta ampio (181 e 247 task). Z.ai lo formula così: *« Capability is growing fastest exactly where we are furthest behind. »* Il post pubblica anche un **Z.ai Security Disclosure Ledger**: **2.436 vulnerabilità identificate in 269 progetti open source** — kernel, sistemi operativi, motori browser, infrastrutture, applicazioni web, protocolli di rete — la più vecchia introdotta nel **1981**, durata media prima della scoperta **26,6 anni**, di cui **53 divulgate** e **2.383 sotto embargo**. **(C) Un rilascio dei pesi** *« within two weeks of launch, once safety evaluation and hardening are complete »*. Il contributo metodologico più riutilizzabile: **sintesi di ambiente e verificatore**, quest'ultimo prodotto senza accesso alla soluzione di riferimento e ammesso solo dopo un tris di controlli negativi — **oracle**, **no-op**, **unsolved-state**. Tutte le valutazioni agentiche sono condotte **in Claude Code 2.1.207**.

#GLM-5.3#GLM-5.2#Z.ai

**Z.ai** (anciennement **Zhipu AI**) · laboratoire d'IA chinois · éditeur de la famille **GLM**. Billet **institutionnel et non signé** : aucun auteur nommé · aucun chercheur mis en avant · aucun lien vers un rapport technique ou une carte de modèle. Publié le **14 août 2026**. La page est une SPA React — le HTML servi est un `<div id="root">` vide · et le texte comme les scores ont dû être extraits du bundle `glm-5.3-BCnx8T5_.js` · où ils figurent en valeurs source.

Politica e Regolamentazione Traduzione verificata automaticamente

Rapport de recherche — « AI Kill Switch Act » : souveraineté, seuils et « so what » pour les entreprises européennes

**Rapporto di Ricerca Interno SFEIR** (documento di preparazione editoriale, basato su deep research — ~70 riferimenti) sull'**AI Kill Switch Act** americano, inquadrato attorno alla **sovranità europea** e al **"so what" per le imprese**. È la **base fattuale** per un futuro articolo di blog — espone dove la tesi della "soglia molto bassa" **regge** e dove necessita di **sfumature**. **Contributo chiave rispetto alla copertura stampa** (incluso [[arstechnica-ai-kill-switch-act-2026-07-23]]): (1) una lettura **del testo stesso della legge** (nuova **sezione 2220F**, "Shutdown-Capability Standard and Graduated Deployment-Corrections Framework", presentata il 23 luglio 2026, 119° Congresso) — autorità conferita al **Segretario del DHS tramite CISA** (il "Direttore"), in consultazione con Commerce + DNI; (2) **due soglie CUMULATIVE** — ≥ **500 milioni di $** di ricavi AI (affiliate incluse) **E** compute di addestramento > **100 milioni di $** — il che significa che **oggi poche aziende sono coperte**, il che **contraddice nettamente** la tesi della "soglia bassa"; (3) ma una **portata reale molto ampia** attraverso il **meccanismo di espansione** (aggiornamenti annuali delle soglie da parte del DHS, clausola "affiliate", compute indicizzato al prezzo del cloud, crescita dei ricavi) e soprattutto attraverso l'**effetto domino** sui clienti; (4) **sanzioni graduate**: fino a **2 milioni di $/giorno** (violazione generale), **20 milioni di $/giorno** (violazione dell'autorità di emergenza); (5) **sfumatura critica**: poiché l'incidente **OpenAI/Hugging Face** si è verificato durante il **red-teaming/valutazione interna**, esso **NON attiverebbe** l'autorità di emergenza così come scritta (il testo esclude il red-teaming). L'angolo di **sovranità** si basa sul **precedente Anthropic** (Fable 5 / Mythos 5 disattivati per **19 giorni** nel giugno 2026) come **prova operativa** di un "kill switch de facto", e conduce a **raccomandazioni per i CTO** (architettura multi-modello testata, clausole di continuità, mappatura dell'esposizione, opzioni sovrane).

#AI Kill Switch Act#section 2220F#Shutdown-Capability Standard

**SFEIR** (recherche interne / deep research). Document non signé nominativement — préparation éditoriale pour le blog SFEIR · dans la ligne souveraineté/adoption du cabinet (cf. [[sfeir-mistral-microsoft-souverainete-strategie-industrielle-2026-07-22]]). Base factuelle équilibrée (arguments **et** contre-arguments) · références numérotées.