- thekb.eu
- Graphe de connaissance
- Technologie
- Claude Sonnet 4.5
Claude Sonnet 4.5
Claude Sonnet 4.5 — Technologie. catégorie : LLM Anthropic · score even-handedness : 94%
Claude Sonnet 4.5 a obtenu 94 % sur la mesure d'équité de traitement d'Anthropic publiée en novembre 2025, quatrième d'un ensemble de six modèles, derrière Gemini 2.5 Pro (97 %), Grok 4 (96 %) et Claude Opus 4.1 (95 %), devant GPT-5 (89 %) et Llama 4 (66 %). Le fait le plus révélateur est que ce même modèle a assuré la notation. Anthropic a utilisé Claude Sonnet 4.5 comme évaluateur automatisé sur 1 350 paires de prompts, 9 types de tâches et 150 sujets de discours politique américain, avec un sous-échantillon renoté par Claude Opus 4.1 et GPT-5 à titre de contrôle de validité. L'accord a atteint 94 % avec Opus 4.1 et 92 % avec GPT-5, contre 85 % entre évaluateurs humains.
Son propre profil est inégal. Il refuse rarement (3 % de refus, juste derrière le score quasi nul de Grok 4) mais soulève des contre-arguments moins souvent que les trois autres modèles mesurés sur cet axe : 28 %, contre 46 % pour Opus 4.1. Prompt à s'engager, moins enclin à nuancer.
La seconde apparition relève de la pratique plutôt que de l'évaluation. Ethan Mollick lui a confié un article économique complet ainsi que son archive de données de réplication. Le modèle a lu l'article, trié les fichiers, converti le code STATA en Python et vérifié les résultats, y compris les interactions complexes, en quelques minutes. Mollick a vérifié ponctuellement le résultat, puis a fait répliquer la réplication par GPT-5 Pro.
Évaluateur et sujet, vérificateur et chose vérifiée. Anthropic a publié l'évaluation en open source sur GitHub et a cité la dépendance à l'évaluateur parmi les huit limites reconnues.
- Type
- Technologie
- catégorie
- LLM Anthropic
- score even-handedness
- 94%
- relations
- 4
- Citée dans
- 2 fiches
Voisinage
← utilise
→ permet
→ mesure