Trasformazione e Adozione Traduzione verificata automaticamente
METHODOLOGIE
GDPval
Benchmark che misura i modelli IA su compiti professionali di livello esperto — finanza, diritto, retail, software — valutati alla cieca da specialisti esperti. I punteggi riportati raggiungono il 40-49 % del livello esperto ma richiedono un'importante impostazione umana, al punto che la metrica stessa è giudicata sotto-specificata.
Origine
Introdotto da OpenAI nel 2025 come benchmark delle prestazioni dell'IA su compiti professionali di livello esperto in più ambiti.
- definizione
- Benchmark expert tasks — i modelli raggiungono il 40-49% del livello esperto umano, ma richiedono *extensive human framing* — la metrica stessa è sottospecificata
- metodo
- Esperti con 14 anni di esperienza, valutazione in cieco
- portata
- Finanza, diritto, retail, sviluppo software
Fiches (3)
Trasformazione e Adozione Traduzione verificata automaticamente
After Automation
Economia e Mercato Traduzione verificata automaticamente