Inicio · Parte 10 — Estadística e inferencia
media = Σxᵢ / n; mediana = valor central ordenado
IQR = Q3 − Q1; σ = √(Σ(xᵢ − x̄)²/n)
con cola derecha: media > mediana
Resumir un conjunto de datos exige responder tres preguntas independientes: dónde está el centro, cuánto se dispersan los valores y qué forma tiene la distribución. Dar solo la media es responder una de tres, y muchas veces la menos informativa.
Para el centro hay tres candidatos con propiedades distintas. La media usa todos los valores y por eso un solo dato extremo la arrastra. La mediana solo mira la posición central y es robusta: cambiar el máximo por uno diez veces mayor no la mueve. La moda es la única que sirve para variables categóricas. Que los salarios se reporten por mediana y no por media no es casualidad.
Para la dispersión, la desviación estándar es la medida clásica y el rango intercuartílico la robusta. El IQR ignora el 25 % de cada cola y es la base del criterio de valores atípicos por diagrama de caja: fuera de Q1 − 1,5·IQR y Q3 + 1,5·IQR.
La forma es lo que más se olvida. La relación entre media y mediana delata la asimetría: si la media supera a la mediana, hay cola a la derecha. Y distribuciones radicalmente distintas pueden compartir media y desviación: el cuarteto de Anscombe y el Datasaurus son la demostración visual de que resumir sin graficar es peligroso.
Veinte mediciones: centro, dispersión y forma.
n = 20
media = 12,6050
mediana = 12,6500 media < mediana → ligera cola izquierda
desviación estándar = 0,8630
rango = 3,2000
Q1 = 11,9250
Q3 = 13,2000
IQR = 1,2750
Límites de atípicos (criterio 1,5·IQR):
inferior: 11,925 − 1,9125 = 10,0125
superior: 13,200 + 1,9125 = 15,1125
ningún dato queda fuera
Sensibilidad: si el máximo pasara de 14,2 a 30,0
media → 13,395 (sube un 6,3 %)
mediana → 12,650 (no cambia)
Centro, dispersión y forma: tres preguntas distintas.
python classes/part-10-estadistica-e-inferencia/201-estadistica-descriptiva/lab.py
compmath run 201
nmediamedianadesviacion_estandarrangoQ1Q3IQRcoeficiente_de_variacion_%asimetria_aprox{
"n": 20,
"media": 12.605,
"mediana": 12.65,
"desviacion_estandar": 0.862966,
"rango": 3.2,
"Q1": 11.925
}
Exploración inicial de cualquier conjunto de datos, informes de latencia por percentiles, detección de atípicos y control de calidad.
Evaluar un modelo es inferencia estadística: métricas con intervalo, comparaciones múltiples corregidas y detección de leakage.
9780387217369 verificado en International ISBN Agency (2026-08-19).