Inicio · Parte 10 — Estadística e inferencia
error total = sesgo + error aleatorio
el error aleatorio ~ 1/√n; el sesgo no depende de n
muestra aleatoria simple: toda unidad con igual probabilidad
Toda inferencia se apoya en un supuesto que rara vez se enuncia: que la muestra representa a la población. Cuando ese supuesto falla, ninguna técnica posterior lo arregla. La estadística sofisticada aplicada a una muestra sesgada produce conclusiones sofisticadas y falsas.
La clave está en distinguir dos fuentes de error. El error aleatorio viene de que la muestra es finita y decae como 1/√n: más datos lo reducen. El sesgo viene de que el mecanismo de selección favorece a ciertos individuos, y es constante en n: más datos no lo tocan. Peor aún, reducen el error aleatorio y estrechan el intervalo, dando más confianza a un número equivocado.
Los ejemplos históricos son elocuentes. La encuesta del Literary Digest de 1936 recogió 2,4 millones de respuestas y predijo mal las elecciones, porque muestreó de listas de propietarios de teléfono y automóvil. Gallup acertó con 50 000 respuestas bien muestreadas. El sesgo del superviviente es la variante más traicionera: estudiar solo empresas que siguen existiendo, aviones que volvieron o usuarios que no abandonaron.
La defensa es de diseño, no de análisis: aleatorizar la selección. Cuando no es posible, hay que declarar el mecanismo de selección y razonar explícitamente sobre a qué población se puede extrapolar. En aprendizaje automático el mismo problema aparece como desplazamiento de distribución entre los datos de entrenamiento y los de producción.
Misma población, dos mecanismos de muestreo.
población: 10 000 individuos, media real = 50,02
muestra aleatoria (n = 500)
media = 49,83 error = 0,20
muestra sesgada (n = 500, favorece valores altos)
media = 61,36 error = 11,34 57 veces peor
Aumentar el sesgado a n = 5 000:
error aleatorio ↓ el sesgo se mantiene en ≈ 11
el intervalo se estrecha alrededor del valor equivocado
Conclusión: 500 datos bien muestreados baten a 5 000 mal muestreados.
Sesgo de selección: la muestra no representa a la población.
python classes/part-10-estadistica-e-inferencia/202-poblacion-muestra-y-sesgo-de-seleccion/lab.py
compmath run 202
media_poblacionalmedia_muestra_aleatoriaerror_muestra_aleatoriamedia_muestra_sesgadaerror_muestra_sesgadael_tamaño_no_corrige_el_sesgoleccion{
"media_poblacional": 50.0216,
"media_muestra_aleatoria": 49.8265,
"error_muestra_aleatoria": 0.1951,
"media_muestra_sesgada": 61.3576,
"error_muestra_sesgada": 11.336,
"el_tamaño_no_corrige_el_sesgo": true
}
Diseño de encuestas, construcción de conjuntos de entrenamiento, auditoría de sesgo en modelos y detección de desplazamiento de distribución en producción.
Evaluar un modelo es inferencia estadística: métricas con intervalo, comparaciones múltiples corregidas y detección de leakage.
9780387217369 verificado en International ISBN Agency (2026-08-19).10.1214/18-aoas1161sf verificado en Crossref (2026-08-19).