- thekb.eu
- Wissensgraph
- Organisation
- Artificial Analysis
Artificial Analysis
Artificial Analysis — Organisation. Rolle: Einziger im Beitrag zitierter unabhängiger Bewerter: liefert die GDPval-AA-v2- und FrontierSWE-Werte der Vergleichstabelle sowie die Durchsatzraten pro Modell, die zur Normierung der ExploitGym-Zeitbudgets dienen
Artificial Analysis veröffentlichte am 22. Juni 2026 einen Vergleich, der Z.ais GLM-5.2 bei 1524 Elo auf GDPval-AA einordnet, Platz drei insgesamt und Platz eins unter den Open-Weights-Modellen, hinter Claude Fable 5 (1783) und Claude Opus 4.8 (1615) und gleichauf mit GPT-5.5 in seiner xhigh-Einstellung (1509). Der Abstand innerhalb des offenen Lagers war groß: MiniMax-M3, das nächstplatzierte offene Modell, kam auf 1408.
Die Methode ist es, die diese Zahl aussagekräftig macht. GDPval-AA bewertet mehrstufige Aufgaben mit langem Zeithorizont, formuliert als berufliche Übungen (die Tagesaufgabenliste einer Filialleitung, ein technisches IEC-Dokument). Artificial Analysis gab GLM-5.2 und drei proprietären Spitzenmodellen identische Vorgaben und stellte anschließend jedes Ergebnis exakt so dar, wie es erzeugt wurde. GLM-5.2 kam über 1.999 Durchläufe hinweg auf durchschnittlich etwa 31 Turns pro Aufgabe. Das Urteil, das Artificial Analysis dem Ergebnis beifügte: Ein Open-Weights-Modell, das zu diesem Preis mit der proprietären Spitze bei tatsächlich nützlicher agentischer Arbeit mithält, sei „a real step for open models".
Zwei Monate später, in Z.ais unsignierter GLM-5.3-Ankündigung vom 14. August 2026, ist Artificial Analysis der einzige externe Bewerter, der noch vorkommt. Die Werte zu GDPval-AA v2 und FrontierSWE in der Vergleichstabelle sind die einzigen Ergebnisse, die einer dritten Partei zugeschrieben werden, und ihre Durchsatzzahlen pro Modell sind es, die die Zeitbudgets für ExploitGym normieren. Der Rest, einschließlich der Z.ai Code Bench-Ergebnisse, die die Behauptung „most capable open-weights model for coding" tragen, stammt aus eigener Hand und ist nicht öffentlich einsehbar. Damit bleibt ein einziger externer Ankerpunkt, der die Glaubwürdigkeit einer Veröffentlichung trägt, deren Cyber-Ergebnisse Z.ai selbst als emergent bezeichnet.
- Typ
- Organisation
- Rolle
- Einziger im Beitrag zitierter unabhängiger Bewerter: liefert die GDPval-AA-v2- und FrontierSWE-Werte der Vergleichstabelle sowie die Durchsatzraten pro Modell, die zur Normierung der ExploitGym-Zeitbudgets dienen
- Relationen
- 3
- Zitiert in
- 2 fiches
Nachbarschaft
→ veröffentlicht