Inicio · Parte 15 — Matemática de Deep Learning
MSE = media de (y − ŷ)²
MAE = media de |y − ŷ|
Huber: cuadrática si |e| ≤ δ, lineal si no
La función de pérdida define qué significa equivocarse, y esa definición cambia por completo el modelo resultante. No es un parámetro secundario: es la especificación del problema.
El error cuadrático medio penaliza el cuadrado del error, así que un error diez veces mayor pesa cien veces más. Eso lo hace extremadamente sensible a los valores atípicos: una sola observación anómala puede dominar la suma y arrastrar el ajuste entero. El error absoluto medio penaliza linealmente y es mucho más robusto, a cambio de no ser derivable en cero y de converger más lentamente.
La pérdida de Huber combina lo mejor de ambas: se comporta como cuadrática para errores pequeños —donde interesa la sensibilidad y la derivabilidad— y como lineal para errores grandes —donde interesa la robustez—. El parámetro δ marca la transición, y es la opción por defecto razonable cuando se sospecha que hay ruido de medición.
Detrás de cada elección hay un modelo probabilístico implícito, como se vio en la clase 215: MSE supone ruido gaussiano, MAE supone ruido de Laplace con colas más pesadas, y entropía cruzada supone un modelo categórico. Elegir pérdida es declarar qué se cree del ruido, y hacerlo explícitamente evita elegir por costumbre.
Cinco observaciones, una de ellas claramente anómala.
objetivos: [1,0 ; 2,0 ; 3,0 ; 4,0 ; 100,0]
predicciones: [1,1 ; 2,1 ; 2,9 ; 4,2 ; 5,0]
MSE = 1805,014
MAE = 19,100
Huber (δ = 1) = 18,907
MSE sin el atípico = 0,0175
El atípico multiplica el MSE por 103 000.
MAE y Huber apenas se descolocan.
Si ese 100,0 es un error de medición, MSE arruina
el ajuste entero por una sola observación.
MSE, MAE, Huber y cross-entropy frente a un valor atípico.
python classes/part-15-matematica-de-deep-learning/304-funciones-de-perdida/lab.py
compmath run 304
objetivosprediccionesMSEMAEHuber_delta_1MSE_sin_el_atipicoel_atipico_domina_el_MSEMAE_es_robustogradiente_MSEgradiente_MAEcuando_usar_cross_entropy{
"objetivos": [
1.0,
2.0,
3.0,
4.0,
100.0
],
"predicciones": [
1.1,
2.1,
2.9,
4.2,
5.0
],
"MSE": 1805.014,
"MAE": 19.1,
"Huber_delta_1": 18.907,
"MSE_sin_el_atipico": 0.0175
}
Regresión robusta, detección de objetos con pérdida Huber, entrenamiento con datos ruidosos y diseño de objetivos personalizados.
Toda arquitectura moderna, incluido el Transformer, se construye sobre estos bloques y sobre este mismo mecanismo de derivación.
10.1214/aoms/1177703732 verificado en Crossref (2026-08-19).9780262337373 verificado en International ISBN Agency (2026-08-19).