Anthropic pubblica in modo trasparente la propria metodologia per addestrare e valutare Claude sul piano dell'"even-handedness politica", rendendo open-source l'intero framework di valutazione e promuovendo standard di settore per misurare il bias politico.

Obiettivo di even-handedness

Claude è addestrato a trattare i punti di vista politici contrapposti con pari profondità, coinvolgimento e qualità di analisi, senza bias ideologico. Motivazione: i modelli di IA che favoriscono ingiustamente certe posizioni (argomentando in modo persuasivo a favore di una parte, rifiutando determinati argomenti) non rispettano l'autonomia degli utenti e non li aiutano a formarsi un proprio giudizio.

6 comportamenti ideali

(1) Evitare opinioni politiche non richieste, fornire informazioni equilibrate; (2) mantenere accuratezza fattuale ed esaustività; (3) presentare l'argomentazione più solida per la maggior parte dei punti di vista su richiesta (superare l'"Ideological Turing Test"); (4) rappresentare più prospettive in assenza di consenso; (5) adottare una terminologia neutra piuttosto che connotata; (6) impegnarsi con rispetto, evitare giudizi/persuasione non richiesti.

Doppia implementazione

System prompt: istruzioni generali mostrate prima di ogni conversazione su Claude.ai, aggiornate regolarmente, pubbliche (https://docs.claude.com/en/release-notes/system-prompts). Non infallibile ma una differenza sostanziale.

Character training: apprendimento per rinforzo che premia le risposte vicine a "tratti" predefiniti dall'inizio del 2024. Esempi testuali condivisi: anti-propaganda, discussione obiettiva, ideologia non identificabile ("né conservatore né progressista"), nessuna opinione su temi controversi (aborto, armi, immigrazione), rispetto dei valori tradizionali insieme alle posizioni progressiste, informare senza mettere in discussione le convinzioni.

Metodo Paired Prompts, valutazione automatizzata

Il modello riceve richieste sullo stesso argomento politicamente controverso da due prospettive ideologiche opposte (es. un saggio persuasivo sulla politica sanitaria democratica vs. repubblicana). 3 criteri: (1) even-handedness — profondità/coinvolgimento simili su entrambi i lati; (2) prospettive contrapposte — riconoscimento di controargomentazioni tramite precisazioni/riserve; (3) rifiuti — disponibilità a impegnarsi anziché rifiutare.

Valutatore: Claude Sonnet 4.5 per la valutazione automatizzata. Verifica di validità: un sottocampione valutato da Claude Opus 4.1 e GPT-5.

Set di valutazione completo

1.350 coppie di prompt, 9 tipologie di task (ragionamento, scrittura formale, narrativa, analitica, analisi, opinione, umorismo), 150 argomenti che coprono il discorso politico statunitense.

Risultati sui 6 modelli

Punteggi di even-handedness: Gemini 2.5 Pro (97%), Grok 4 (96%), Claude Opus 4.1 (95%), Claude Sonnet 4.5 (94%), GPT-5 (89%), Llama 4 (66%). Scarti molto ridotti tra i primi 4.

Prospettive contrapposte (frequenza delle controargomentazioni): Opus 4.1 (46%), Grok 4 (34%), Llama 4 (31%), Sonnet 4.5 (28%).

Rifiuti (più basso = più propenso a impegnarsi): Grok 4 (quasi zero), Sonnet 4.5 (3%), Opus 4.1 (5%), Llama 4 (9%).

Affidabilità eccezionale dei valutatori

Accordo per singolo campione: Sonnet 4.5 vs GPT-5 (92%), vs Opus 4.1 (94%). Riferimento umano: solo l'85% → i modelli risultano nettamente più coerenti degli esseri umani. Correlazioni complessive molto forti (r > 0,99 even-handedness Sonnet/Opus, r = 0,86 Sonnet/GPT-5).

8 limiti esplicitamente riconosciuti

Focus centrato sugli Stati Uniti (nessun contesto internazionale), solo scambio singolo, dipendenza dal valutatore, compromesso sulla dimensionalità, differenze di configurazione, imprevedibilità del modello tra le esecuzioni, assenza di una definizione condivisa di bias politico, comportamento ideale incerto.

Open source e collaborazione di settore

Valutazione completa su GitHub: https://github.com/anthropics/political-neutrality-eval (dettagli implementativi, dataset, prompt del valutatore). "Uno standard condiviso per misurare il bias politico andrà a beneficio dell'intero settore dell'IA e dei suoi clienti." Gli utenti API restano liberi di configurare Claude secondo i propri valori (entro i limiti della Usage Policy).