🧮 Computational Mathematics

Inicio · Parte 14 — Matemática de Machine Learning

283 — Ridge y regularización L2

ml-avanzado clase 3 de 20 4 horas demostración ridge

Ridge encoge los coeficientes y con ello arregla el mal condicionamiento.

Fórmulas

J(w) = ‖Xw − y‖² + λ‖w‖²
solución: w = (XᵀX + λI)⁻¹Xᵀy
sumar λI mejora el número de condición

Desarrollo

Ridge añade a la regresión una penalización proporcional a la suma de los cuadrados de los coeficientes. El efecto es encoger todos los coeficientes hacia cero, con más intensidad cuanto mayor sea λ, sin anular ninguno.

La solución cerrada revela algo elegante: el término de regularización aparece como λI sumado a XᵀX. Eso desplaza todos los autovalores hacia arriba en λ, lo que mejora el número de condición y garantiza que la matriz sea invertible aunque XᵀX fuera singular. Ridge resuelve un problema numérico y un problema estadístico con la misma operación.

El problema estadístico es la colinealidad. Cuando dos características están muy correlacionadas, sus coeficientes individuales quedan mal determinados: pueden compensarse con valores enormes y de signo opuesto sin que el ajuste empeore. Ridge penaliza esa magnitud y reparte el peso entre ambas de forma estable.

Dos precauciones que importan. Primera: hay que estandarizar antes, porque la penalización depende de la escala y una característica medida en milímetros recibiría un trato distinto que la misma en metros. Segunda: el término independiente no se regulariza, porque encogerlo no tiene sentido —solo desplaza el nivel— y sesgaría las predicciones.

Ejemplo trabajado

Efecto de λ sobre coeficientes, error y condicionamiento.

  λ         pesos                        ‖w‖₂
 0,0   [2,032145 ; 1,488677 ; −0,353039]  2,5437
 0,1   [2,022454 ; 1,490112 ; −0,351255]  2,5366
 1,0   [1,944037 ; 1,497998 ; −0,328931]  2,4762
10,0   [1,473261 ; 1,486815 ; −0,080571]  2,0947

Ningún coeficiente llega a ser exactamente cero.

Número de condición:
  sin regularizar: 364,65
  con λ = 1:       258,72

La regularización estabiliza el problema numérico
además de controlar el sobreajuste.

Qué calcula el laboratorio

Ridge: L2 encoge los coeficientes y estabiliza el mal condicionamiento.

python classes/part-14-matematica-de-machine-learning/283-ridge-y-regularizacion-l2/lab.py
compmath run 283

Salidas del laboratorio (8)

Muestra de la ejecución real

{
  "λ=0.0": {
    "pesos": [
      2.032145,
      1.488677,
      -0.353039
    ],
    "norma_L2": 2.5437,
    "MSE": 0.07572774
  },
  "λ=0.1": {
    "pesos": [
      2.022454,
      1.490112,
      -0.351255
    ],
    "norma_L2": 2.536559,
    "MSE": 0.07575788
  },
  "λ=1.0": {
    "pesos": [
      1.944037,
      1.497998,
      -0.328931
    ],
    "norma_L2": 2.476181,
    "MSE": 0.07848195
  },
  "λ=10.0": {
    "pesos": [
      1.473261,
      1.486815,
      -0.080571
    ],
    "norma_L2": 2.094662,
    "MSE": 0.21707829
  },
  "condicion_sin_regularizar": 364.65,
  "condicion_con_λ=1": 258.72
}

Errores comunes

Dónde se usa

Regresión con características correlacionadas, weight decay en redes, estabilización de problemas mal condicionados y regularización por defecto.

Idea rectora de la parte

El kernel trick evita construir el espacio de características explícitamente.

Error a evitar

Interpretar coeficientes de un modelo con features correlacionadas.

Conexión con IA

Estos algoritmos siguen siendo la línea base honesta contra la que se debe comparar cualquier modelo profundo.

Bibliografía de la clase

Archivos de la clase