Inicio · Parte 10 — Estadística e inferencia
remuestrear n observaciones con reposición, B veces
SE_bootstrap = desviación estándar de las B réplicas
IC percentil: cuantiles 2,5 % y 97,5 % de las réplicas
El bootstrap parte de una idea que suena a trampa: usar la muestra como si fuera la población. Se extraen B muestras del mismo tamaño con reposición de los datos originales, se calcula el estadístico en cada una, y la dispersión de esas B réplicas estima la variabilidad del estadístico.
Su valor está en que funciona para estadísticos sin fórmula cerrada. Para la media existe σ/√n, pero para la mediana, el percentil 95, la razón de dos medias, el coeficiente de correlación o una métrica de evaluación de un modelo, deducir el error estándar analíticamente es difícil o imposible. El bootstrap lo obtiene igual en todos los casos, cambiando análisis por cómputo.
El intervalo percentil se lee directamente de los cuantiles de las réplicas, sin suponer normalidad ni simetría. Con distribuciones asimétricas produce intervalos asimétricos, que es lo correcto, mientras que el intervalo ±1,96·SE fuerza simetría aunque los datos no la tengan.
No es magia y tiene límites claros. Sigue exigiendo que la muestra sea representativa —el bootstrap no arregla el sesgo de selección de la clase 202— y falla con estadísticos de valores extremos, como el máximo, porque el remuestreo no puede generar valores que no estaban. Con datos dependientes hay que usar variantes por bloques.
Bootstrap de la media con 20 observaciones y 10 000 réplicas.
n = 20 B = 10 000
media observada = 12,6050
SE bootstrap = 0,188371
SE teórico = 0,192965 coinciden al 2 % ✓
IC 95 % percentil: (12,235 , 12,980)
IC 95 % paramétrico: (12,227 , 12,983)
Ventaja real: la mediana no tiene fórmula sencilla de SE,
y el bootstrap la da con el mismo procedimiento.
Límite: para el máximo el bootstrap subestima gravemente
la variabilidad, porque nunca genera valores nuevos.
Bootstrap: estimar la variabilidad sin suponer la distribución.
python classes/part-10-estadistica-e-inferencia/218-bootstrap-y-remuestreo/lab.py
compmath run 218
nreplicasmedia_observadaSE_bootstrap_de_la_mediaSE_teoricoIC_95%_percentil_mediaSE_bootstrap_de_la_medianaventaja{
"n": 20,
"replicas": 10000,
"media_observada": 12.605,
"SE_bootstrap_de_la_media": 0.188371,
"SE_teorico": 0.192965,
"IC_95%_percentil_media": [
12.235,
12.98
]
}
Intervalos de confianza para métricas de modelos, comparación de algoritmos, estimación de incertidumbre en estadísticos complejos y bagging.
Evaluar un modelo es inferencia estadística: métricas con intervalo, comparaciones múltiples corregidas y detección de leakage.
9780429246593 verificado en International ISBN Agency (2026-08-19).9780387217369 verificado en International ISBN Agency (2026-08-19).