Saltar al contenido
Metodología

GDPval

GDPval — Metodología. definición: Benchmark expert tasks — los modelos alcanzan el 40-49% del nivel experto humano, pero requieren *extensive human framing* — la métrica en sí está subespecificada · método: Expertos con 14 años de experiencia, evaluación a ciegas · alcance: Finanzas, derecho, retail, desarrollo de software

Los expertos, con una media de 14 años de experiencia, elaboran las tareas: proyectos realistas que a un humano le llevan de cuatro a siete horas. Varios modelos de IA y expertos humanos los completan a continuación, y un tercer panel de expertos evalúa los resultados a ciegas, dedicando más de una hora por pregunta. Ethan Mollick, en noviembre de 2025, contrasta este diseño con MMLU-Pro y sus semejantes, cuyas claves de respuestas públicas pueden filtrarse al entrenamiento y cuyas preguntas ("capacidad craneal media del Homo erectus?") miden algo que nadie sabe nombrar.

Las puntuaciones que arroja apuntan en dos direcciones. Jasmine Sun, en el NYT en abril de 2026, informa de que el benchmark de OpenAI cubre 44 profesiones y alcanza una tasa de victoria superior al 80% frente a profesionales humanos en cuestión de meses, y lo sitúa dentro del debate de Silicon Valley sobre el desplazamiento del trabajo de cuello blanco. Dan Shipper, un mes después, cita entre el 40 y el 49% del nivel de un experto humano, y añade la condición asociada a esa cifra: un extenso encuadre humano. La métrica en sí está poco especificada.

Lo que muestran los resultados tarea por tarea es desigualdad más que una frontera única. Mollick informa de que la IA supera a los humanos en desarrollo de software y asesoramiento financiero, mientras que farmacéuticos, ingenieros industriales y agentes inmobiliarios superan a la IA, y de que los modelos divergen entre sí: ChatGPT es el mejor director de ventas, Claude el mejor asesor financiero.

Así, un mismo benchmark, que abarca finanzas, derecho, comercio minorista y desarrollo de software, se lee a la vez como prueba de que los modelos han llegado y como prueba de que alguien todavía tiene que fijar el marco.

Tipo
Metodología
definición
Benchmark expert tasks — los modelos alcanzan el 40-49% del nivel experto humano, pero requieren *extensive human framing* — la métrica en sí está subespecificada
método
Expertos con 14 años de experiencia, evaluación a ciegas
alcance
Finanzas, derecho, retail, desarrollo de software
relaciones
5
Citada en
3 fiches

Métricas de adopción

Vecindario

44 occupations humai… Jagged Frontier

→ mide

44 occupations humaines CONCEPT confianza alta estable Fuente ↗
Jagged Frontier CONCEPT confianza alta estable Fuente ↗

Citada en (3)