Anthropic - Misurare il bias politico in Claude - Even-handedness 94-95% - Metodo Paired Prompts - Valutazione open-source - Character training - Confronto tra 6 modelli - System prompt di neutralità - GitHub
Benchmark AI oltre i test standard - Intervistare i modelli AI per casi d'uso specifici - Jagged Frontier - OpenAI GDPval - Vibes vs misurazioni reali - Esempio GuacaDrone - Ethan Mollick - One Useful Thing