Zum Inhalt springen

root / tags / exploitgym

#ExploitGym

2 Fiches

Qualität & Sicherheit Automatisch geprüfte Übersetzung

GLM-5.3: Frontier Coding with Emergent Cyber Capabilities

Ankündigungsbeitrag, veröffentlicht im **offiziellen Z.ai-Blog** (ehemals Zhipu AI, chinesisches Labor) am **14. August 2026**, **ohne namentliche Autorenangabe**, ~2.000 Wörter plus Fußnoten. Er kündigt **GLM-5.3** an, den Nachfolger von GLM-5.2, und eröffnet mit einer methodischen These: *« Scaling post-training is all we did for GLM-5.3. »* Dasselbe Basismodell wie GLM-5.2 — *« every gain comes from post-training »*. Drei Ankündigungen. **(A) Ein Coding-Modell mit offenen Gewichten**: +50 % beansprucht auf **Z.ai Code Bench**, einem unveröffentlichten internen Benchmark. **(B) Eine als „emergent" dargestellte Cyber-Fähigkeit**, die der Fließtext auf eine Trainingsentscheidung zurückführt — *« As part of post-training, we introduced vulnerability discovery data and environments into the training mix. We expected this to make the model better at finding and reasoning about vulnerabilities »* — überraschend waren die Geschwindigkeit und der Wandel in der Natur: Das Modell geht von der Identifizierung isolierter Schwachstellen zu *« coherent plans for complete exploitation chains »* über. Die Gewinne wachsen mit der Position in der Exploitation-Kette: CyberGym 77,2 → **84,5 %**, ExploitBench 24,4 → **54,4 %** (×2,2), ExploitGym 29 → **105** Aufgaben in 2 h (×3,6), wobei der Abstand zur geschlossenen Frontier weiterhin groß bleibt (181 und 247 Aufgaben). Z.ai formuliert es so: *« Capability is growing fastest exactly where we are furthest behind. »* Der Beitrag veröffentlicht zudem ein **Z.ai Security Disclosure Ledger**: **2.436 identifizierte Schwachstellen in 269 Open-Source-Projekten** — Kernel, Betriebssysteme, Browser-Engines, Infrastruktur, Webanwendungen, Netzwerkprotokolle — die älteste eingeführt **1981**, durchschnittliche Lebensdauer bis zur Entdeckung **26,6 Jahre**, davon **53 offengelegt** und **2.383 unter Embargo**. **(C) Eine Gewichtsfreigabe** *« within two weeks of launch, once safety evaluation and hardening are complete »*. Der am ehesten übertragbare methodische Beitrag: **Synthese von Umgebungen und Verifiern**, wobei Letztere ohne Zugriff auf die Referenzlösung erzeugt und erst nach einem Triptychon negativer Kontrollen zugelassen werden — **oracle**, **no-op**, **unsolved-state**. Alle agentischen Evaluierungen werden **in Claude Code 2.1.207** durchgeführt.

#GLM-5.3#GLM-5.2#Z.ai

**Z.ai** (anciennement **Zhipu AI**) · laboratoire d'IA chinois · éditeur de la famille **GLM**. Billet **institutionnel et non signé** : aucun auteur nommé · aucun chercheur mis en avant · aucun lien vers un rapport technique ou une carte de modèle. Publié le **14 août 2026**. La page est une SPA React — le HTML servi est un `<div id="root">` vide · et le texte comme les scores ont dû être extraits du bundle `glm-5.3-BCnx8T5_.js` · où ils figurent en valeurs source.

Politik & Regulierung Automatisch geprüfte Übersetzung

Rapport de recherche — « AI Kill Switch Act » : souveraineté, seuils et « so what » pour les entreprises européennes

**SFEIR-interner Recherchebericht** (redaktionelles Vorbereitungsdokument, gestützt auf Deep Research – ~70 Quellen) zum amerikanischen **AI Kill Switch Act**, ausgerichtet auf die **europäische Souveränität** und die **„So what“-Frage für Unternehmen**. Er bildet die **faktische Grundlage** für einen künftigen Blogartikel – er zeigt auf, wo die These der „sehr niedrigen Schwelle“ **zutrifft** und wo sie **nuanciert** werden muss. **Zentraler Mehrwert gegenüber der Presseberichterstattung** (einschließlich [[arstechnica-ai-kill-switch-act-2026-07-23]]): (1) eine Lektüre **des Gesetzestexts selbst** (neue **Section 2220F**, „Shutdown-Capability Standard and Graduated Deployment-Corrections Framework“, eingebracht am 23. Juli 2026, 119. Kongress) – die Befugnis liegt beim **DHS-Secretary über die CISA** (dem „Director“), in Abstimmung mit Commerce + DNI; (2) **zwei KUMULATIVE Schwellenwerte** – ≥ **500 Mio. $** KI-Umsatz (einschließlich verbundener Unternehmen) **UND** Trainings-Compute > **100 Mio. $** – das heißt, **heute sind nur wenige Labore betroffen**, was der „niedrige Schwelle“-These **strikt widerspricht**; (3) aber eine **sehr breite reale Reichweite** durch den **Ausweitungsmechanismus** (jährliche Anpassung der Schwellenwerte durch das DHS, „Affiliates“-Klausel, an Cloud-Preise gekoppeltes Compute, Umsatzwachstum) und vor allem durch den **Dominoeffekt** auf Kunden; (4) **gestaffelte Sanktionen**: bis zu **2 Mio. $/Tag** (allgemeiner Verstoß), **20 Mio. $/Tag** (Verstoß gegen die Notfallbefugnis); (5) **entscheidende Nuance**: da der **OpenAI/Hugging-Face**-Vorfall während **Red-Teaming/interner Evaluierung** auftrat, **würde er die Notfallbefugnis nicht auslösen**, so wie der Text derzeit formuliert ist (er schließt Red-Teaming aus). Der **Souveränitäts**-Aspekt stützt sich auf den **Anthropic-Präzedenzfall** (Fable 5 / Mythos 5 für **19 Tage** im Juni 2026 abgeschaltet) als **operativen Beweis** für einen „faktischen Kill Switch“ und mündet in **CTO-Empfehlungen** (getestete Multi-Modell-Architektur, Kontinuitätsklauseln, Expositions-Mapping, souveräne Optionen).

#AI Kill Switch Act#section 2220F#Shutdown-Capability Standard

**SFEIR** (recherche interne / deep research). Document non signé nominativement — préparation éditoriale pour le blog SFEIR · dans la ligne souveraineté/adoption du cabinet (cf. [[sfeir-mistral-microsoft-souverainete-strategie-industrielle-2026-07-22]]). Base factuelle équilibrée (arguments **et** contre-arguments) · références numérotées.