🧮 Computational Mathematics

Inicio · Parte 10 — Estadística e inferencia

207 — p-value correctamente interpretado

universitario-avanzado clase 7 de 20 4 horas demostración p_value

El p-value mide la rareza de los datos bajo H0, no la probabilidad de que H0 sea cierta.

Fórmulas

p = P(estadístico tan o más extremo | H0 cierta)
p ≠ P(H0 | datos)
bajo H0, el p-value se distribuye Uniforme(0,1)

Desarrollo

El p-value responde a una pregunta muy concreta: si la hipótesis nula fuera cierta, ¿con qué frecuencia se verían datos al menos tan extremos como los observados? Es una probabilidad condicionada a H0, no una probabilidad de H0. Esa inversión ilegítima es la misma falacia del fiscal de la clase 186, aplicada a la práctica científica.

Hay un hecho que aclara todo lo demás: bajo H0, el p-value es uniforme en el intervalo unitario. Cualquier valor es igual de probable. Por eso rechazar con p < 0,05 produce exactamente un 5 % de falsos positivos cuando no hay ningún efecto; el umbral no es mágico, es simplemente la fracción de la uniforme que se decide sacrificar.

De la uniformidad se deduce el mecanismo del p-hacking. Si se prueban 20 análisis distintos sobre datos sin efecto, la probabilidad de que alguno baje de 0,05 es 1 − 0,95²⁰ ≈ 64 %. Probar variantes, subgrupos, transformaciones o momentos de parada hasta obtener significancia no es análisis exploratorio: es fabricar resultados. La defensa es preinscribir el análisis y corregir por comparaciones múltiples.

Y hay una última confusión, independiente de las anteriores: significancia no es relevancia. Con n suficientemente grande, cualquier diferencia por minúscula que sea resulta significativa. Un p-value pequeño dice que el efecto probablemente no es cero; no dice que importe. Por eso hay que reportar siempre el tamaño del efecto y su intervalo.

Ejemplo trabajado

Distribución del p-value cuando no hay efecto alguno.

100 000 experimentos simulados con H0 cierta

  media de los p-values          = 0,49789    ≈ 0,5 (uniforme)
  proporción con p < 0,05        = 0,05750    ≈ 5 %
  proporción con p < 0,01        = 0,01417    ≈ 1 %

El 5 % de los estudios "encuentra" un efecto inexistente.

Comparaciones múltiples sin corrección:
  k = 1    P(algún falso positivo) = 5 %
  k = 5                            = 23 %
  k = 20                           = 64 %
  k = 100                          = 99,4 %

Corrección de Bonferroni: usar α/k en cada contraste.

Qué calcula el laboratorio

Qué mide y qué no mide un p-value.

python classes/part-10-estadistica-e-inferencia/207-p-value-correctamente-interpretado/lab.py
compmath run 207

Salidas del laboratorio (8)

Muestra de la ejecución real

{
  "definicion": "P(estadístico tan o más extremo | H0 cierta)",
  "no_es": "P(H0 | datos)",
  "bajo_H0_es_uniforme": true,
  "proporcion_p<0.05": 0.0575,
  "proporcion_p<0.01": 0.01417,
  "media_de_los_p": 0.49789
}

Errores comunes

Dónde se usa

Interpretación de literatura científica, evaluación de experimentos A/B, comparación de modelos y auditoría de resultados publicados.

Idea rectora de la parte

Un intervalo de confianza describe el procedimiento, no una probabilidad del parámetro.

Error a evitar

p-hacking por comparaciones múltiples sin corrección.

Conexión con IA

Evaluar un modelo es inferencia estadística: métricas con intervalo, comparaciones múltiples corregidas y detección de leakage.

Bibliografía de la clase

Archivos de la clase