🧮 Computational Mathematics

Inicio · Parte 14 — Matemática de Machine Learning

282 — Regresión lineal desde mínimos cuadrados

ml-avanzado clase 2 de 20 4 horas demostración linear_regression

Regresión lineal tiene solución cerrada, y el descenso de gradiente llega al mismo sitio.

Fórmulas

ŷ = Xw;   J(w) = ‖Xw − y‖²
solución cerrada: w = (XᵀX)⁻¹Xᵀy
gradiente: ∇J = 2Xᵀ(Xw − y)

Desarrollo

La regresión lineal minimiza la suma de residuos al cuadrado. Es el algoritmo más antiguo del catálogo —Gauss y Legendre, principios del siglo XIX— y sigue siendo la línea base obligada porque es interpretable, rápido y difícil de superar cuando la relación es realmente lineal.

Tiene la propiedad rara de admitir solución cerrada. Anular el gradiente da las ecuaciones normales, y su solución es la fórmula de la proyección de la parte 05. Casi ningún otro modelo permite eso: la regresión logística, sin ir más lejos, ya requiere iterar.

Aun así, en la práctica se usa el descenso de gradiente cuando hay muchas observaciones o muchas características, porque invertir XᵀX cuesta O(d³) y la matriz puede estar mal condicionada. Que ambos caminos converjan al mismo punto es la comprobación numérica que valida las dos implementaciones a la vez.

Elegir el error cuadrático no es arbitrario: equivale a suponer ruido gaussiano y maximizar la verosimilitud, como se vio en la clase 215. Sus consecuencias son conocidas: penaliza los errores grandes de forma desproporcionada y por tanto es muy sensible a valores atípicos. Si esa sensibilidad molesta, la respuesta correcta es cambiar el modelo de ruido —pérdida de Huber, regresión cuantílica— y no parchear el algoritmo.

Ejemplo trabajado

Sesenta observaciones, tres características, dos métodos.

parámetros reales: [2,0 ; 1,5 ; −0,4]

solución cerrada:      [2,032145 ; 1,488677 ; −0,353039]
descenso de gradiente: [2,031712 ; 1,489061 ; −0,353651]

coinciden a 3 decimales                              ✓
MSE de la solución cerrada: 0,0757

La diferencia con los parámetros reales viene del ruido
de las 60 observaciones, no del método.

Coste: cerrada O(d³) por la inversión;
       gradiente O(n·d) por iteración.

Qué calcula el laboratorio

Regresión lineal: solución cerrada y descenso de gradiente.

python classes/part-14-matematica-de-machine-learning/282-regresion-lineal-desde-minimos-cuadrados/lab.py
compmath run 282

Salidas del laboratorio (9)

Muestra de la ejecución real

{
  "observaciones": 60,
  "features": 3,
  "parametros_reales": [
    2.0,
    1.5,
    -0.4
  ],
  "solucion_cerrada": [
    2.032145,
    1.488677,
    -0.353039
  ],
  "descenso_de_gradiente": [
    2.031712,
    1.489061,
    -0.353651
  ],
  "MSE_cerrada": 0.07572774
}

Errores comunes

Dónde se usa

Línea base en cualquier problema de regresión, análisis de tendencias, calibración de instrumentos y capa final de muchos modelos.

Idea rectora de la parte

Ridge y Lasso resuelven el mismo problema con normas distintas y geometría distinta.

Error a evitar

Elegir hiperparámetros con el conjunto de test.

Conexión con IA

Estos algoritmos siguen siendo la línea base honesta contra la que se debe comparar cualquier modelo profundo.

Bibliografía de la clase

Archivos de la clase