Artificial Analysis — eine unabhängige Plattform zur Bewertung von KI-Modellen — veröffentlicht (X/Twitter-Thread vom 22. Juni 2026 + eine ausführliche Modellseite) einen Vergleich, der GLM-5.2, das neueste Modell von Z.ai (Zhipu AI), an die Spitze der Open-Weights-Modelle und auf Platz 3 im Gesamtranking von GDPval-AA setzt. Dieser Benchmark misst die Leistung bei realer, wirtschaftlich wertvoller Wissensarbeit anhand von long-horizon, multi-turn Aufgaben, die als echte berufliche Übungen konzipiert sind (zum Beispiel die tägliche Aufgabenliste eines Filialleiters im Einzelhandel oder ein technisches IEC-Dokument) und sowohl berufliche als auch kreative Arbeit abdecken.
GLM-5.2 erzielt 1524 Elo, nur hinter Claude Fable 5 (1783) und Claude Opus 4.8 (1615), und liegt gleichauf mit GPT-5.5 in der xhigh-Einstellung (1509). Vor allem dominiert es das offene Feld mit deutlichem Abstand: Das nächstbeste Open-Modell, MiniMax-M3, erreicht nur 1408. GLM-5.2 übertrifft zudem mehrere proprietäre Modelle — Gemini 3.5 Flash (1357), Qwen 3.7 Max (1289) und Muse Spark (1158).
Der agentische Charakter der Aufgaben wird hervorgehoben: GLM-5.2 benötigte im Durchschnitt ~31 Turns pro Aufgabe über 1.999 Matches. Die Methode von Artificial Analysis besteht darin, identische Briefings an GLM-5.2 und drei proprietäre Spitzenmodelle (Fable 5, GPT-5.5, Gemini 3.5 Flash) zu geben und anschließend jedes Ergebnis genau so darzustellen, wie es erzeugt wurde. Das Ergebnis ist über die eigenen Indizes des Unternehmens hinweg konsistent: GLM-5.2 belegt Platz 1 unter den Open-Weights-Modellen im Intelligence Index, Platz 3 im Agentic Index und Platz 3 bei AA-Briefcase (wo es das führende Open-Modell ist, vor GPT-5.5 xhigh und nur hinter Fable 5).
Die Modellseite ergänzt das Bild: GLM-5.2 ist ein Mixture of Experts mit 753 Milliarden Parametern (davon 40 Milliarden aktiv), ein Reasoning-Modell mit 1M-Token-Kontext, das unter MIT-Lizenz vertrieben wird (kommerzielle Nutzung, Gewichte auf Hugging Face), veröffentlicht am 16. Juni 2026. Zur Wirtschaftlichkeit: 1,40 $ / 4,40 $ pro Million Tokens (Input/Output), ein Cache-Hit zu 0,26 $ (-81 %), ein Durchsatz von 106,3 Tokens/s und eine Time to First Token von 1,36 s.
Die durch die Zahlen vermittelte Botschaft ist klar: Dass ein Open-Weights-Modell zu diesem Preis mit der proprietären Spitze bei wirklich nützlicher agentischer Arbeit konkurriert, stellt laut Artificial Analysis "einen echten Schritt für offene Modelle" dar. Die Konvergenz zwischen offenen und proprietären Modellen spielt sich nicht mehr allein auf akademischen Tests ab, sondern beim unter agentischen Bedingungen erzeugten wirtschaftlichen Wert.