🧮 Computational Mathematics

Inicio · Parte 10 — Estadística e inferencia

202 — Población, muestra y sesgo de selección

universitario-avanzado clase 2 de 20 4 horas demostración population_sample

El sesgo de selección no se corrige con más datos: solo se vuelve más convincente.

Fórmulas

error total = sesgo + error aleatorio
el error aleatorio ~ 1/√n; el sesgo no depende de n
muestra aleatoria simple: toda unidad con igual probabilidad

Desarrollo

Toda inferencia se apoya en un supuesto que rara vez se enuncia: que la muestra representa a la población. Cuando ese supuesto falla, ninguna técnica posterior lo arregla. La estadística sofisticada aplicada a una muestra sesgada produce conclusiones sofisticadas y falsas.

La clave está en distinguir dos fuentes de error. El error aleatorio viene de que la muestra es finita y decae como 1/√n: más datos lo reducen. El sesgo viene de que el mecanismo de selección favorece a ciertos individuos, y es constante en n: más datos no lo tocan. Peor aún, reducen el error aleatorio y estrechan el intervalo, dando más confianza a un número equivocado.

Los ejemplos históricos son elocuentes. La encuesta del Literary Digest de 1936 recogió 2,4 millones de respuestas y predijo mal las elecciones, porque muestreó de listas de propietarios de teléfono y automóvil. Gallup acertó con 50 000 respuestas bien muestreadas. El sesgo del superviviente es la variante más traicionera: estudiar solo empresas que siguen existiendo, aviones que volvieron o usuarios que no abandonaron.

La defensa es de diseño, no de análisis: aleatorizar la selección. Cuando no es posible, hay que declarar el mecanismo de selección y razonar explícitamente sobre a qué población se puede extrapolar. En aprendizaje automático el mismo problema aparece como desplazamiento de distribución entre los datos de entrenamiento y los de producción.

Ejemplo trabajado

Misma población, dos mecanismos de muestreo.

población: 10 000 individuos,  media real = 50,02

muestra aleatoria (n = 500)
  media = 49,83        error = 0,20

muestra sesgada (n = 500, favorece valores altos)
  media = 61,36        error = 11,34        57 veces peor

Aumentar el sesgado a n = 5 000:
  error aleatorio ↓        el sesgo se mantiene en ≈ 11
  el intervalo se estrecha alrededor del valor equivocado

Conclusión: 500 datos bien muestreados baten a 5 000 mal muestreados.

Qué calcula el laboratorio

Sesgo de selección: la muestra no representa a la población.

python classes/part-10-estadistica-e-inferencia/202-poblacion-muestra-y-sesgo-de-seleccion/lab.py
compmath run 202

Salidas del laboratorio (7)

Muestra de la ejecución real

{
  "media_poblacional": 50.0216,
  "media_muestra_aleatoria": 49.8265,
  "error_muestra_aleatoria": 0.1951,
  "media_muestra_sesgada": 61.3576,
  "error_muestra_sesgada": 11.336,
  "el_tamaño_no_corrige_el_sesgo": true
}

Errores comunes

Dónde se usa

Diseño de encuestas, construcción de conjuntos de entrenamiento, auditoría de sesgo en modelos y detección de desplazamiento de distribución en producción.

Idea rectora de la parte

Un intervalo de confianza describe el procedimiento, no una probabilidad del parámetro.

Error a evitar

Confundir significancia estadística con relevancia práctica.

Conexión con IA

Evaluar un modelo es inferencia estadística: métricas con intervalo, comparaciones múltiples corregidas y detección de leakage.

Bibliografía de la clase

Archivos de la clase