Vai al contenuto
Metodologia

GDPval

GDPval — Metodologia. definizione: Benchmark expert tasks — i modelli raggiungono il 40-49% del livello esperto umano, ma richiedono *extensive human framing* — la metrica stessa è sottospecificata · metodo: Esperti con 14 anni di esperienza, valutazione in cieco · portata: Finanza, diritto, retail, sviluppo software

Esperti con una media di 14 anni di esperienza costruiscono i compiti: progetti realistici che richiedono da quattro a sette ore a una persona. Diversi modelli di IA ed esperti umani li completano poi, e un terzo gruppo di esperti valuta i risultati alla cieca, dedicando oltre un'ora a ciascuna domanda. Ethan Mollick, scrivendo nel novembre 2025, mette a confronto questo impianto con MMLU-Pro e i suoi simili, le cui chiavi di risposta pubbliche possono infiltrarsi nell'addestramento e le cui domande ("capacità cranica media dell'Homo erectus?") misurano qualcosa che nessuno sa definire.

I punteggi che ne emergono puntano in due direzioni. Jasmine Sun, sul NYT nell'aprile 2026, riporta che il benchmark di OpenAI copre 44 professioni e raggiunge un tasso di vittoria superiore all'80% rispetto ai professionisti umani nel giro di pochi mesi, collocandolo all'interno del dibattito della Silicon Valley sulla sostituzione dei colletti bianchi. Dan Shipper, un mese dopo, cita un livello pari al 40-49% rispetto all'esperto umano, aggiungendo la condizione legata a quella cifra: un'ampia strutturazione umana del compito. La metrica stessa è definita in modo insufficiente.

Ciò che i risultati compito per compito mostrano è disomogeneità, non un'unica frontiera. Mollick riporta l'IA superare gli esseri umani nello sviluppo software e nella consulenza finanziaria, mentre farmacisti, ingegneri industriali e agenti immobiliari superano l'IA, e i modelli divergono tra loro: ChatGPT il miglior direttore vendite, Claude il miglior consulente finanziario.

Così un unico benchmark, che spazia tra finanza, diritto, vendita al dettaglio e sviluppo software, viene letto sia come prova che i modelli sono arrivati, sia come prova che qualcuno deve ancora definire la cornice.

Tipo
Metodologia
definizione
Benchmark expert tasks — i modelli raggiungono il 40-49% del livello esperto umano, ma richiedono *extensive human framing* — la metrica stessa è sottospecificata
metodo
Esperti con 14 anni di esperienza, valutazione in cieco
portata
Finanza, diritto, retail, sviluppo software
relazioni
5
Citata in
3 fiches

Metriche di adozione

Vicinato

44 occupations humai… Jagged Frontier

→ misura

44 occupations humaines CONCEPT affidabilità alta stabile Fonte ↗
Jagged Frontier CONCEPT affidabilità alta stabile Fonte ↗

Citata in (3)