Inicio · Parte 10 — Estadística e inferencia
p = P(estadístico tan o más extremo | H0 cierta)
p ≠ P(H0 | datos)
bajo H0, el p-value se distribuye Uniforme(0,1)
El p-value responde a una pregunta muy concreta: si la hipótesis nula fuera cierta, ¿con qué frecuencia se verían datos al menos tan extremos como los observados? Es una probabilidad condicionada a H0, no una probabilidad de H0. Esa inversión ilegítima es la misma falacia del fiscal de la clase 186, aplicada a la práctica científica.
Hay un hecho que aclara todo lo demás: bajo H0, el p-value es uniforme en el intervalo unitario. Cualquier valor es igual de probable. Por eso rechazar con p < 0,05 produce exactamente un 5 % de falsos positivos cuando no hay ningún efecto; el umbral no es mágico, es simplemente la fracción de la uniforme que se decide sacrificar.
De la uniformidad se deduce el mecanismo del p-hacking. Si se prueban 20 análisis distintos sobre datos sin efecto, la probabilidad de que alguno baje de 0,05 es 1 − 0,95²⁰ ≈ 64 %. Probar variantes, subgrupos, transformaciones o momentos de parada hasta obtener significancia no es análisis exploratorio: es fabricar resultados. La defensa es preinscribir el análisis y corregir por comparaciones múltiples.
Y hay una última confusión, independiente de las anteriores: significancia no es relevancia. Con n suficientemente grande, cualquier diferencia por minúscula que sea resulta significativa. Un p-value pequeño dice que el efecto probablemente no es cero; no dice que importe. Por eso hay que reportar siempre el tamaño del efecto y su intervalo.
Distribución del p-value cuando no hay efecto alguno.
100 000 experimentos simulados con H0 cierta
media de los p-values = 0,49789 ≈ 0,5 (uniforme)
proporción con p < 0,05 = 0,05750 ≈ 5 %
proporción con p < 0,01 = 0,01417 ≈ 1 %
El 5 % de los estudios "encuentra" un efecto inexistente.
Comparaciones múltiples sin corrección:
k = 1 P(algún falso positivo) = 5 %
k = 5 = 23 %
k = 20 = 64 %
k = 100 = 99,4 %
Corrección de Bonferroni: usar α/k en cada contraste.
Qué mide y qué no mide un p-value.
python classes/part-10-estadistica-e-inferencia/207-p-value-correctamente-interpretado/lab.py
compmath run 207
definicionno_esbajo_H0_es_uniformeproporcion_p<0.05proporcion_p<0.01media_de_los_priesgo_de_20_pruebascorreccion_de_Bonferroni_alfa{
"definicion": "P(estadístico tan o más extremo | H0 cierta)",
"no_es": "P(H0 | datos)",
"bajo_H0_es_uniforme": true,
"proporcion_p<0.05": 0.0575,
"proporcion_p<0.01": 0.01417,
"media_de_los_p": 0.49789
}
Interpretación de literatura científica, evaluación de experimentos A/B, comparación de modelos y auditoría de resultados publicados.
Evaluar un modelo es inferencia estadística: métricas con intervalo, comparaciones múltiples corregidas y detección de leakage.
9780387217369 verificado en International ISBN Agency (2026-08-19).10.1080/00031305.2016.1154108 verificado en Crossref (2026-08-19).