🧮 Computational Mathematics

Inicio · Parte 15 — Matemática de Deep Learning

304 — Funciones de pérdida

deep-learning clase 4 de 20 4 horas demostración loss_functions

Un solo valor atípico multiplica el MSE por cien mil; Huber lo absorbe.

Fórmulas

MSE = media de (y − ŷ)²
MAE = media de |y − ŷ|
Huber: cuadrática si |e| ≤ δ, lineal si no

Desarrollo

La función de pérdida define qué significa equivocarse, y esa definición cambia por completo el modelo resultante. No es un parámetro secundario: es la especificación del problema.

El error cuadrático medio penaliza el cuadrado del error, así que un error diez veces mayor pesa cien veces más. Eso lo hace extremadamente sensible a los valores atípicos: una sola observación anómala puede dominar la suma y arrastrar el ajuste entero. El error absoluto medio penaliza linealmente y es mucho más robusto, a cambio de no ser derivable en cero y de converger más lentamente.

La pérdida de Huber combina lo mejor de ambas: se comporta como cuadrática para errores pequeños —donde interesa la sensibilidad y la derivabilidad— y como lineal para errores grandes —donde interesa la robustez—. El parámetro δ marca la transición, y es la opción por defecto razonable cuando se sospecha que hay ruido de medición.

Detrás de cada elección hay un modelo probabilístico implícito, como se vio en la clase 215: MSE supone ruido gaussiano, MAE supone ruido de Laplace con colas más pesadas, y entropía cruzada supone un modelo categórico. Elegir pérdida es declarar qué se cree del ruido, y hacerlo explícitamente evita elegir por costumbre.

Ejemplo trabajado

Cinco observaciones, una de ellas claramente anómala.

objetivos:    [1,0 ; 2,0 ; 3,0 ; 4,0 ; 100,0]
predicciones: [1,1 ; 2,1 ; 2,9 ; 4,2 ;   5,0]

MSE            = 1805,014
MAE            =   19,100
Huber (δ = 1)  =   18,907

MSE sin el atípico = 0,0175

El atípico multiplica el MSE por 103 000.
MAE y Huber apenas se descolocan.

Si ese 100,0 es un error de medición, MSE arruina
el ajuste entero por una sola observación.

Qué calcula el laboratorio

MSE, MAE, Huber y cross-entropy frente a un valor atípico.

python classes/part-15-matematica-de-deep-learning/304-funciones-de-perdida/lab.py
compmath run 304

Salidas del laboratorio (11)

Muestra de la ejecución real

{
  "objetivos": [
    1.0,
    2.0,
    3.0,
    4.0,
    100.0
  ],
  "predicciones": [
    1.1,
    2.1,
    2.9,
    4.2,
    5.0
  ],
  "MSE": 1805.014,
  "MAE": 19.1,
  "Huber_delta_1": 18.907,
  "MSE_sin_el_atipico": 0.0175
}

Errores comunes

Dónde se usa

Regresión robusta, detección de objetos con pérdida Huber, entrenamiento con datos ruidosos y diseño de objetivos personalizados.

Idea rectora de la parte

Normalizar estabiliza la escala interna y permite tasas de aprendizaje mayores.

Error a evitar

Inicializar todos los pesos iguales y romper la simetría nunca.

Conexión con IA

Toda arquitectura moderna, incluido el Transformer, se construye sobre estos bloques y sobre este mismo mecanismo de derivación.

Bibliografía de la clase

Archivos de la clase