Saltar al contenido

METHODOLOGIE

GDPval

Benchmark que mide los modelos de IA en tareas profesionales de nivel experto — finanzas, derecho, retail, software — evaluadas a ciegas por especialistas experimentados. Las puntuaciones reportadas alcanzan el 40-49 % del nivel experto, pero exigen un encuadre humano considerable, por lo que la métrica en sí se considera subespecificada.

Origen

Introducido por OpenAI en 2025 como benchmark del rendimiento de la IA en tareas profesionales de nivel experto en varios ámbitos.

definición
Benchmark expert tasks — los modelos alcanzan el 40-49% del nivel experto humano, pero requieren *extensive human framing* — la métrica en sí está subespecificada
método
Expertos con 14 años de experiencia, evaluación a ciegas
alcance
Finanzas, derecho, retail, desarrollo de software

Fiches (3)