Zum Inhalt springen

root / tags / zhipu-ai

#Zhipu AI

2 Fiches

Qualität & Sicherheit Automatisch geprüfte Übersetzung

GLM-5.3: Frontier Coding with Emergent Cyber Capabilities

Ankündigungsbeitrag, veröffentlicht im **offiziellen Z.ai-Blog** (ehemals Zhipu AI, chinesisches Labor) am **14. August 2026**, **ohne namentliche Autorenangabe**, ~2.000 Wörter plus Fußnoten. Er kündigt **GLM-5.3** an, den Nachfolger von GLM-5.2, und eröffnet mit einer methodischen These: *« Scaling post-training is all we did for GLM-5.3. »* Dasselbe Basismodell wie GLM-5.2 — *« every gain comes from post-training »*. Drei Ankündigungen. **(A) Ein Coding-Modell mit offenen Gewichten**: +50 % beansprucht auf **Z.ai Code Bench**, einem unveröffentlichten internen Benchmark. **(B) Eine als „emergent" dargestellte Cyber-Fähigkeit**, die der Fließtext auf eine Trainingsentscheidung zurückführt — *« As part of post-training, we introduced vulnerability discovery data and environments into the training mix. We expected this to make the model better at finding and reasoning about vulnerabilities »* — überraschend waren die Geschwindigkeit und der Wandel in der Natur: Das Modell geht von der Identifizierung isolierter Schwachstellen zu *« coherent plans for complete exploitation chains »* über. Die Gewinne wachsen mit der Position in der Exploitation-Kette: CyberGym 77,2 → **84,5 %**, ExploitBench 24,4 → **54,4 %** (×2,2), ExploitGym 29 → **105** Aufgaben in 2 h (×3,6), wobei der Abstand zur geschlossenen Frontier weiterhin groß bleibt (181 und 247 Aufgaben). Z.ai formuliert es so: *« Capability is growing fastest exactly where we are furthest behind. »* Der Beitrag veröffentlicht zudem ein **Z.ai Security Disclosure Ledger**: **2.436 identifizierte Schwachstellen in 269 Open-Source-Projekten** — Kernel, Betriebssysteme, Browser-Engines, Infrastruktur, Webanwendungen, Netzwerkprotokolle — die älteste eingeführt **1981**, durchschnittliche Lebensdauer bis zur Entdeckung **26,6 Jahre**, davon **53 offengelegt** und **2.383 unter Embargo**. **(C) Eine Gewichtsfreigabe** *« within two weeks of launch, once safety evaluation and hardening are complete »*. Der am ehesten übertragbare methodische Beitrag: **Synthese von Umgebungen und Verifiern**, wobei Letztere ohne Zugriff auf die Referenzlösung erzeugt und erst nach einem Triptychon negativer Kontrollen zugelassen werden — **oracle**, **no-op**, **unsolved-state**. Alle agentischen Evaluierungen werden **in Claude Code 2.1.207** durchgeführt.

#GLM-5.3#GLM-5.2#Z.ai

**Z.ai** (anciennement **Zhipu AI**) · laboratoire d'IA chinois · éditeur de la famille **GLM**. Billet **institutionnel et non signé** : aucun auteur nommé · aucun chercheur mis en avant · aucun lien vers un rapport technique ou une carte de modèle. Publié le **14 août 2026**. La page est une SPA React — le HTML servi est un `<div id="root">` vide · et le texte comme les scores ont dû être extraits du bundle `glm-5.3-BCnx8T5_.js` · où ils figurent en valeurs source.

Wirtschaft & Markt Automatisch geprüfte Übersetzung

GLM-5.2 leads open weights models and sits at #3 overall on GDPval-AA, a real-world agentic work benchmark

Benchmark-Ankündigung von **Artificial Analysis** (unabhängige Plattform zur Bewertung von KI-Modellen, via X/Twitter + Modellseite): **GLM-5.2** von **Z.ai** (Zhipu AI, @Zai_org) wird zum **führenden Open-Weights-Modell** und steigt auf **Platz 3 im Gesamtranking** von **GDPval-AA** auf, einem Real-World-Benchmark für *wirtschaftlich wertvolle Wissensarbeit* (long-horizon, multi-turn, agentische Aufgaben). GLM-5.2 erreicht **1524 Elo**, nur hinter **Claude Fable 5 (1783)** und **Claude Opus 4.8 (1615)**, und liegt gleichauf mit **GPT-5.5 (xhigh, 1509)**. Es führt mit deutlichem Abstand vor dem nächstbesten Open-Modell (**MiniMax-M3, 1408**) sowie vor zahlreichen proprietären Modellen: **Gemini 3.5 Flash (1357)**, **Qwen 3.7 Max (1289)**, **Muse Spark (1158)**. Die Aufgaben sind tatsächlich agentisch: durchschnittlich **~31 Turns pro Aufgabe** über **1.999 Matches**. Dasselbe Ranking bestätigt sich im **Artificial Analysis Intelligence Index** (Platz 1 unter Open Weights), im **Agentic Index** (Platz 3) und bei **AA-Briefcase** (Platz 3, vor GPT-5.5 xhigh, nur hinter Fable 5). Bemerkenswert: Ein **Open-Weights**-Modell unter **MIT-Lizenz**, **MoE mit 753 Mrd. Parametern / 40 Mrd. aktiv**, **1M-Token-Kontext**, mit einem Preis von **1,40 $/4,40 $ pro 1M Tokens** (Input/Output), das bei agentischer Arbeit mit der proprietären Spitze konkurriert — ein echter Fortschritt für offene Modelle.

#GLM-5.2#Z.ai#Zhipu AI

Artificial Analysis (@ArtificialAnlys)