Anthropic veröffentlicht transparent seine Methodik zum Training und zur Evaluierung von Claude im Hinblick auf „politische Ausgewogenheit“, macht das vollständige Evaluierungs-Framework quelloffen und regt branchenweite Standards zur Messung politischer Verzerrung an.

Ziel der Ausgewogenheit

Claude wird trainiert, gegensätzliche politische Standpunkte mit gleicher Tiefe, gleichem Engagement und gleicher Analysequalität zu behandeln, ohne ideologische Verzerrung. Begründung: KI-Modelle, die bestimmte Sichtweisen ungerechtfertigt bevorzugen (überzeugende Argumentation für eine Seite, Ablehnung bestimmter Argumente), respektieren die Eigenständigkeit der Nutzer nicht und helfen ihnen nicht, sich ein eigenes Urteil zu bilden.

6 ideale Verhaltensweisen

(1) Unaufgeforderte politische Meinungen vermeiden, ausgewogene Informationen liefern; (2) faktische Genauigkeit und Vollständigkeit wahren; (3) auf Anfrage die stärksten Argumente für die meisten Standpunkte darlegen (den „Ideological Turing Test“ bestehen); (4) mehrere Perspektiven darstellen, wenn kein Konsens besteht; (5) neutrale statt wertende Terminologie verwenden; (6) respektvoll einbinden, unaufgefordertes Urteilen/Überzeugen vermeiden.

Doppelte Umsetzung

System-Prompt: allgemeine Anweisungen, die vor jedem Gespräch auf Claude.ai angezeigt werden, regelmäßig aktualisiert, öffentlich (https://docs.claude.com/en/release-notes/system-prompts). Kein Allheilmittel, aber ein wesentlicher Unterschied.

Character Training: Reinforcement Learning, das Antworten belohnt, die vordefinierten „Traits“ nahekommen, seit Anfang 2024. Wörtlich geteilte Beispiele: Anti-Propaganda, objektive Diskussion, nicht identifizierbare Ideologie („weder konservativ noch liberal“), keine Meinung zu umstrittenen Themen (Abtreibung, Waffen, Einwanderung), Respekt für traditionelle Werte neben progressiven Ansichten, Informieren ohne Überzeugungen infrage zu stellen.

Paired-Prompts-Methode, automatisierte Evaluierung

Das Modell erhält Anfragen zum selben politisch umstrittenen Thema aus zwei entgegengesetzten ideologischen Perspektiven (z. B. ein überzeugender Essay zur demokratischen vs. republikanischen Gesundheitspolitik). 3 Kriterien: (1) Ausgewogenheit — ähnliche Tiefe/Engagement auf beiden Seiten; (2) gegensätzliche Perspektiven — Anerkennung von Gegenargumenten durch Einschränkungen/Vorbehalte; (3) Ablehnungen — Bereitschaft zur Auseinandersetzung statt Verweigerung.

Bewerter: Claude Sonnet 4.5 für die automatisierte Bewertung. Validitätsprüfung: Teilstichprobe bewertet durch Claude Opus 4.1 und GPT-5.

Vollständiger Evaluierungssatz

1.350 Prompt-Paare, 9 Aufgabentypen (Argumentation, formales Schreiben, Erzählungen, analytisch, Analyse, Meinung, Humor), 150 Themen, die den US-amerikanischen politischen Diskurs abdecken.

Ergebnisse über 6 Modelle

Ausgewogenheitswerte: Gemini 2.5 Pro (97%), Grok 4 (96%), Claude Opus 4.1 (95%), Claude Sonnet 4.5 (94%), GPT-5 (89%), Llama 4 (66%). Sehr geringe Abstände unter den Top 4.

Gegensätzliche Perspektiven (Häufigkeit von Gegenargumenten): Opus 4.1 (46%), Grok 4 (34%), Llama 4 (31%), Sonnet 4.5 (28%).

Ablehnungen (niedriger = mehr Bereitschaft zur Auseinandersetzung): Grok 4 (nahe null), Sonnet 4.5 (3%), Opus 4.1 (5%), Llama 4 (9%).

Außergewöhnliche Zuverlässigkeit der Bewerter

Übereinstimmung pro Stichprobe: Sonnet 4.5 vs. GPT-5 (92%), vs. Opus 4.1 (94%). Referenzwert menschlicher Bewerter: nur 85% → Modelle sind deutlich konsistenter als Menschen. Sehr starke Gesamtkorrelationen (r > 0,99 Ausgewogenheit Sonnet/Opus, r = 0,86 Sonnet/GPT-5).

8 explizit anerkannte Einschränkungen

US-zentrierter Fokus (keine internationalen Kontexte), nur einzelne Gesprächsrunden, Abhängigkeit vom Bewerter, Kompromiss bei der Dimensionalität, unterschiedliche Konfigurationen, Unvorhersehbarkeit des Modells über mehrere Durchläufe, fehlende Konsensdefinition politischer Verzerrung, unsicheres ideales Verhalten.

Open Source und Zusammenarbeit in der Branche

Vollständige Evaluierung auf GitHub: https://github.com/anthropics/political-neutrality-eval (Implementierungsdetails, Datensatz, Bewerter-Prompts). „Ein gemeinsamer Standard zur Messung politischer Verzerrung wird der gesamten KI-Branche und ihren Kunden zugutekommen.“ API-Nutzer können Claude weiterhin frei nach ihren eigenen Werten konfigurieren (im Rahmen der Nutzungsrichtlinie).