P62 — Validez de benchmarks

Ruta de fundamentos · Trae al campo la validez de constructo: un número alto no prueba la capacidad que el benchmark dice medir, y a veces mide un atajo.

Nivel: L3 · Motor: benchmark_validez · Notebook: P62_benchmark_validez.ipynb · Anexo: probabilidad y verosimilitud

1. Identificación

Campo Valor
Título original AI and the Everything in the Whole Wide World Benchmark
Autoría Inioluwa Deborah Raji, Emily M. Bender, Amandalynne Paullada, Emily Denton, Alex Hanna
Año 2021
Venue NeurIPS 2021 · Datasets and Benchmarks Track · arXiv:2111.15366
Fuente primaria arXiv:2111.15366
Acceso Abierto
Fecha de consulta 2026-08-17

2. Problema anterior

Los benchmarks pasaron de ser herramientas de comparación acotada a presentarse como pruebas de capacidades generales: «comprensión de lenguaje natural», «razonamiento», «sentido común».

El salto es de escala pero también de tipo. Un conjunto de ítems mide lo que miden sus ítems. Si la etiqueta promete un constructo general y los ítems cubren una porción estrecha —y encima admiten estrategias que los superan sin la capacidad—, el ranking mide otra cosa distinta de la que nombra. El campo no tenía vocabulario para señalar ese problema.

3. Propuesta

Importar de la psicometría el concepto de validez de constructo y aplicarlo a los benchmarks como instrumentos de medida. Las preguntas que propone hacerle a cualquier benchmark:

El título alude al libro infantil de Grover: un «museo de todo lo que hay en el mundo entero» que resulta contener una sola habitación. La tesis es que un benchmark general es una contradicción, no un objetivo difícil.

4. Intuición sin fórmulas

Un examen de conducir que solo evalúa aparcar en línea. Quien lo aprueba sabe aparcar. Llamarlo «examen de conducción» es una promesa que los ejercicios no respaldan.

Peor todavía: si en ese examen el aparcamiento correcto siempre está en el mismo lado, se aprueba memorizando el lado. La nota sube y la capacidad no.

Dónde deja de funcionar la analogía: el examen de conducir tiene un dominio bien definido. Los constructos que nombran los benchmarks de IA —«comprensión», «razonamiento»— no lo tienen, y esa es justamente la mitad del problema.

5. Matemática mínima

No hay formalismo. Hay un procedimiento de auditoría, que la miniatura ejecuta sobre un benchmark ficticio de 12 ítems:

capacidad declarada     : «comprensión de lenguaje natural»
subhabilidades declaradas: 6
subhabilidades medidas   : 2          ← cobertura 2/6

estrategia sin capacidad : «responder siempre la opción más larga»
    aciertos: 11/12  =  91,7 %
azar (4 opciones)        :  3/12  =  25,0 %

Una regla que no lee el ítem saca 91,7 %. El número publicado por el benchmark no distingue esa estrategia de la capacidad que dice medir, y ninguna métrica de agregación va a arreglarlo: el problema está en los ítems, no en la media.

6. Arquitectura o flujo

flowchart TD
    CO["constructo declarado<br/>«comprensión»"] -->|"se operacionaliza como"| T["conjunto de ítems"]
    T --> N["número publicado"]
    N -->|"se lee como"| CO
    T -.->|"cobertura 2/6"| H1["hueco de cobertura"]
    T -.->|"atajo 11/12"| H2["hueco de validez"]
    style H1 fill:#3a1a1a,stroke:#f85149,color:#f0f6fc
    style H2 fill:#3a1a1a,stroke:#f85149,color:#f0f6fc

7. Qué observar en el paper original

8. Evidencia y resultados

Es un artículo de análisis conceptual con estudios de caso, no un experimento. Su aportación es un marco de evaluación, no una medición.

La evidencia empírica que respalda su tesis viene de otra literatura: el aprendizaje por atajos (Geirhos et al., 2020) y el sesgo de los conjuntos de datos (Torralba y Efros, 2011).

La miniatura de este eje construye un benchmark ficticio para que el modo de fallo se pueda ver y contar. No mide ningún benchmark real, y no debe leerse como si lo hiciera.

9. Impacto

10. Limitaciones

  1. No propone un benchmark alternativo. Es un diagnóstico; construir instrumentos válidos es más difícil que señalar su invalidez.
  2. La validez de constructo viene de la psicometría, donde los constructos tienen décadas de teoría detrás. Trasplantarla a «razonamiento» no es inmediato.
  3. El criterio de «demasiado general» no está operacionalizado. Queda como juicio.
  4. No cuantifica cuántos benchmarks en uso sufren el problema ni en qué grado.
  5. Puede leerse como nihilismo evaluativo, y no lo es: la conclusión es medir cosas más estrechas y nombrarlas con precisión, no dejar de medir.

11. Errores comunes

Error Corrección
«El problema se arregla con más ítems» Si los ítems admiten el mismo atajo, más ítems dan el mismo número con más decimales. El problema es de diseño, no de tamaño.
«Si dos modelos se evalúan igual, la comparación es justa» Es justa entre ellos y sobre ese instrumento. No autoriza a hablar de la capacidad que el instrumento nombra.
«La validez es un problema de la métrica» La métrica puede ser perfecta. El problema es la distancia entre lo que miden los ítems y lo que afirma la etiqueta.
«Un benchmark general es un objetivo difícil pero deseable» La tesis del artículo es que es una contradicción: la generalidad no se operacionaliza en un conjunto finito de ítems.
«Basta con que el conjunto de test no se haya filtrado al entrenamiento» Es necesario y no suficiente. Sin fuga de datos, un atajo de formato sigue produciendo una puntuación alta sin capacidad.

12. Relación con trabajos anteriores

13. Relación con trabajos posteriores

14. Notebook asociado

P62_benchmark_validez.ipynb

Qué implementa: la auditoría de un benchmark ficticio: cobertura declarada frente a real, puntuación de una estrategia sin capacidad, línea del azar y muestra de ítems a inspeccionar a mano.

Qué NO implementa: no evalúa ningún benchmark real ni ningún modelo. Los ítems son inventados para exhibir el modo de fallo, y no deben citarse como resultado.

ai-evolution paper-lab P62 --seed 7

15. Actividades Bloom

Nivel Actividad
Recordar Define validez de constructo con tus palabras.
Explicar Explica por qué una puntuación alta puede ser compatible con no tener la capacidad.
Aplicar Ejecuta el notebook y calcula la ventaja del atajo sobre el azar.
Analizar Analiza por qué añadir más ítems no resuelve el problema.
Evaluar «El modelo A comprende mejor el lenguaje porque saca más puntos». Evalúa la afirmación.
Crear Audita un benchmark real de tu área: lee veinte ítems, identifica el constructo declarado, la cobertura y un atajo posible.

16. Autoevaluación

  1. ¿Qué es la validez de constructo?
  2. ¿Qué mide realmente un benchmark que admite un atajo?
  3. ¿Por qué el artículo sostiene que un benchmark general es una contradicción?
  4. ¿Resuelve el problema añadir más ítems?
  5. ¿Qué hace distinto a un benchmark con verificación externa?
  6. ¿Aporta el artículo mediciones propias?
  7. ¿Cuál es el procedimiento mínimo antes de citar una puntuación?

17. Respuestas esperadas

  1. La correspondencia entre lo que un instrumento mide y el concepto que dice medir. Un instrumento puede ser fiable y preciso y aun así medir otra cosa.
  2. Mide el atajo. En la miniatura, «responder la opción más larga» acierta 11 de 12 frente a 3 de 12 del azar, sin ninguna capacidad detrás.
  3. Porque la generalidad no se puede operacionalizar en un conjunto finito de ítems: cualquier conjunto concreto cubre una porción y deja fuera el resto, por grande que sea.
  4. No, si los ítems nuevos comparten el mismo atajo o la misma cobertura estrecha. Se obtiene el mismo número con menos varianza, que es peor: parece más sólido.
  5. Que el criterio de acierto no depende del formato del ítem. En SWE-bench, pasar los tests del repositorio es difícil de fingir con una heurística de superficie.
  6. No. Es análisis conceptual con estudios de caso. La evidencia empírica de los atajos viene de otra literatura, como Geirhos et al. (2020).
  7. Tres pasos: leer una muestra de ítems, buscar una estrategia que los supere sin la capacidad, y comprobar qué parte del constructo declarado cubren realmente.

18. Fuentes primarias


⬅️ Anterior: P61 Loros estocásticos · 📇 Índice · 📝 Evaluación · 🏫 Clase 010 · Cómo leer papers, benchmarks y claims de IA · ➡️ Siguiente: P63 Reproducibilidad