🧮 Computational Mathematics

Inicio · Parte 10 — Estadística e inferencia

214 — Regresión lineal estadística

universitario-avanzado clase 14 de 20 4 horas demostración linear_regression_stats

Un R² alto no valida el modelo: los residuos son los que lo hacen.

Fórmulas

ŷ = b₀ + b₁x,   b₁ = Σ(x−x̄)(y−ȳ) / Σ(x−x̄)²
R² = 1 − SS_res / SS_tot
t = b₁ / SE(b₁),  gl = n − 2

Desarrollo

La regresión lineal ajusta la recta que minimiza la suma de residuos al cuadrado. Vista desde el álgebra lineal es la proyección de la parte 05; vista desde la estadística, cada coeficiente es un estimador con su error estándar, su intervalo de confianza y su contraste de significancia.

El coeficiente de determinación mide qué fracción de la variabilidad de y explica el modelo. Es útil pero se sobreinterpreta: un alto no garantiza que el modelo sea correcto, ni que la relación sea causal, ni que sirva para predecir fuera del rango observado. Añadir variables sin sentido siempre sube el , y por eso existe el ajustado.

Lo que sí valida el modelo son los residuos. Deben aparecer sin estructura: sin curvatura —que indicaría relación no lineal—, sin embudo —que indicaría varianza no constante— y sin patrón temporal —que indicaría dependencia—. El cuarteto de Anscombe construye cuatro conjuntos con idénticos coeficientes y de los que solo uno merece una recta.

La significancia de la pendiente contrasta H0: b₁ = 0, es decir, que x no aporta nada. Como en toda la parte, lo que hay que reportar es la pendiente con su intervalo: dice cuánto cambia y por unidad de x y con qué precisión, que es la información útil para decidir.

Ejemplo trabajado

Ocho puntos con relación casi perfectamente lineal.

n = 8

intercepto b₀ = 0,1750
pendiente  b₁ = 1,9917

R² = 0,998227           SS_residual = 0,295833
SE(b₁) = 0,034263

t = 1,9917 / 0,034263 = 58,13     gl = 6
p < 0,0001   →  la pendiente es claramente distinta de cero

IC 95 % de la pendiente:
  1,9917 ± 2,447 × 0,034263 = (1,9078 , 2,0755)

Lectura: cada unidad de x aumenta y en ≈ 1,99, con
una precisión de ±0,08. Eso es lo que hay que reportar.

Qué calcula el laboratorio

Regresión lineal con R², error estándar y significancia.

python classes/part-10-estadistica-e-inferencia/214-regresion-lineal-estadistica/lab.py
compmath run 214

Salidas del laboratorio (9)

Muestra de la ejecución real

{
  "n": 8,
  "intercepto": 0.175,
  "pendiente": 1.991667,
  "R²": 0.998227,
  "SS_residual": 0.295833,
  "error_estandar_pendiente": 0.034263
}

Errores comunes

Dónde se usa

Modelos base en aprendizaje automático, análisis de tendencias, calibración de instrumentos y estimación de elasticidades.

Idea rectora de la parte

Correlación no implica causalidad, pero causalidad sí restringe la correlación.

Error a evitar

Confundir significancia estadística con relevancia práctica.

Conexión con IA

Evaluar un modelo es inferencia estadística: métricas con intervalo, comparaciones múltiples corregidas y detección de leakage.

Bibliografía de la clase

Archivos de la clase