Inicio · Parte 14 — Matemática de Machine Learning
J(w) = ‖Xw − y‖² + λ‖w‖²
solución: w = (XᵀX + λI)⁻¹Xᵀy
sumar λI mejora el número de condición
Ridge añade a la regresión una penalización proporcional a la suma de los cuadrados de los coeficientes. El efecto es encoger todos los coeficientes hacia cero, con más intensidad cuanto mayor sea λ, sin anular ninguno.
La solución cerrada revela algo elegante: el término de regularización aparece como λI sumado a XᵀX. Eso desplaza todos los autovalores hacia arriba en λ, lo que mejora el número de condición y garantiza que la matriz sea invertible aunque XᵀX fuera singular. Ridge resuelve un problema numérico y un problema estadístico con la misma operación.
El problema estadístico es la colinealidad. Cuando dos características están muy correlacionadas, sus coeficientes individuales quedan mal determinados: pueden compensarse con valores enormes y de signo opuesto sin que el ajuste empeore. Ridge penaliza esa magnitud y reparte el peso entre ambas de forma estable.
Dos precauciones que importan. Primera: hay que estandarizar antes, porque la penalización depende de la escala y una característica medida en milímetros recibiría un trato distinto que la misma en metros. Segunda: el término independiente no se regulariza, porque encogerlo no tiene sentido —solo desplaza el nivel— y sesgaría las predicciones.
Efecto de λ sobre coeficientes, error y condicionamiento.
λ pesos ‖w‖₂
0,0 [2,032145 ; 1,488677 ; −0,353039] 2,5437
0,1 [2,022454 ; 1,490112 ; −0,351255] 2,5366
1,0 [1,944037 ; 1,497998 ; −0,328931] 2,4762
10,0 [1,473261 ; 1,486815 ; −0,080571] 2,0947
Ningún coeficiente llega a ser exactamente cero.
Número de condición:
sin regularizar: 364,65
con λ = 1: 258,72
La regularización estabiliza el problema numérico
además de controlar el sobreajuste.
Ridge: L2 encoge los coeficientes y estabiliza el mal condicionamiento.
python classes/part-14-matematica-de-machine-learning/283-ridge-y-regularizacion-l2/lab.py
compmath run 283
λ=0.0λ=0.1λ=1.0λ=10.0condicion_sin_regularizarcondicion_con_λ=1ridge_nunca_anula_coeficientessolucion_cerrada{
"λ=0.0": {
"pesos": [
2.032145,
1.488677,
-0.353039
],
"norma_L2": 2.5437,
"MSE": 0.07572774
},
"λ=0.1": {
"pesos": [
2.022454,
1.490112,
-0.351255
],
"norma_L2": 2.536559,
"MSE": 0.07575788
},
"λ=1.0": {
"pesos": [
1.944037,
1.497998,
-0.328931
],
"norma_L2": 2.476181,
"MSE": 0.07848195
},
"λ=10.0": {
"pesos": [
1.473261,
1.486815,
-0.080571
],
"norma_L2": 2.094662,
"MSE": 0.21707829
},
"condicion_sin_regularizar": 364.65,
"condicion_con_λ=1": 258.72
}
Regresión con características correlacionadas, weight decay en redes, estabilización de problemas mal condicionados y regularización por defecto.
Estos algoritmos siguen siendo la línea base honesta contra la que se debe comparar cualquier modelo profundo.
10.1080/00401706.1970.10488634 verificado en Crossref (2026-08-19).9780387848570 verificado en International ISBN Agency (2026-08-19).