🧮 Computational Mathematics

Inicio · Parte 10 — Estadística e inferencia

201 — Estadística descriptiva

universitario-avanzado clase 1 de 20 4 horas demostración descriptive_statistics

Centro, dispersión y forma responden preguntas distintas y ninguna basta sola.

Fórmulas

media = Σxᵢ / n;  mediana = valor central ordenado
IQR = Q3 − Q1;  σ = √(Σ(xᵢ − x̄)²/n)
con cola derecha: media > mediana

Desarrollo

Resumir un conjunto de datos exige responder tres preguntas independientes: dónde está el centro, cuánto se dispersan los valores y qué forma tiene la distribución. Dar solo la media es responder una de tres, y muchas veces la menos informativa.

Para el centro hay tres candidatos con propiedades distintas. La media usa todos los valores y por eso un solo dato extremo la arrastra. La mediana solo mira la posición central y es robusta: cambiar el máximo por uno diez veces mayor no la mueve. La moda es la única que sirve para variables categóricas. Que los salarios se reporten por mediana y no por media no es casualidad.

Para la dispersión, la desviación estándar es la medida clásica y el rango intercuartílico la robusta. El IQR ignora el 25 % de cada cola y es la base del criterio de valores atípicos por diagrama de caja: fuera de Q1 − 1,5·IQR y Q3 + 1,5·IQR.

La forma es lo que más se olvida. La relación entre media y mediana delata la asimetría: si la media supera a la mediana, hay cola a la derecha. Y distribuciones radicalmente distintas pueden compartir media y desviación: el cuarteto de Anscombe y el Datasaurus son la demostración visual de que resumir sin graficar es peligroso.

Ejemplo trabajado

Veinte mediciones: centro, dispersión y forma.

n = 20

media               = 12,6050
mediana             = 12,6500     media < mediana → ligera cola izquierda
desviación estándar =  0,8630
rango               =  3,2000
Q1                  = 11,9250
Q3                  = 13,2000
IQR                 =  1,2750

Límites de atípicos (criterio 1,5·IQR):
  inferior: 11,925 − 1,9125 = 10,0125
  superior: 13,200 + 1,9125 = 15,1125
  ningún dato queda fuera

Sensibilidad: si el máximo pasara de 14,2 a 30,0
  media   → 13,395   (sube un 6,3 %)
  mediana → 12,650   (no cambia)

Qué calcula el laboratorio

Centro, dispersión y forma: tres preguntas distintas.

python classes/part-10-estadistica-e-inferencia/201-estadistica-descriptiva/lab.py
compmath run 201

Salidas del laboratorio (10)

Muestra de la ejecución real

{
  "n": 20,
  "media": 12.605,
  "mediana": 12.65,
  "desviacion_estandar": 0.862966,
  "rango": 3.2,
  "Q1": 11.925
}

Errores comunes

Dónde se usa

Exploración inicial de cualquier conjunto de datos, informes de latencia por percentiles, detección de atípicos y control de calidad.

Idea rectora de la parte

El p-value es P(datos tan extremos | H0), nunca P(H0 | datos).

Error a evitar

p-hacking por comparaciones múltiples sin corrección.

Conexión con IA

Evaluar un modelo es inferencia estadística: métricas con intervalo, comparaciones múltiples corregidas y detección de leakage.

Bibliografía de la clase

Archivos de la clase