Inicio · Parte 14 — Matemática de Machine Learning
CE = −log p(clase correcta)
MSE = (p − y)² ≤ 1 siempre
CE → ∞ cuando p → 0
Comparar entropía cruzada con error cuadrático en clasificación revela por qué la primera es la elección correcta, y la razón es cuantitativa antes que teórica: cómo penalizan la confianza equivocada.
El error cuadrático está acotado. Con probabilidades entre 0 y 1, el error máximo posible es 1, así que un modelo completamente seguro y completamente equivocado recibe una penalización finita y modesta. La entropía cruzada, en cambio, crece sin límite: si la probabilidad asignada a la respuesta correcta tiende a cero, la pérdida tiende a infinito.
Ese comportamiento es exactamente el deseable. Un modelo que dice «99 % seguro» y falla merece un castigo mucho mayor que uno que dice «55 % seguro» y falla, porque la afirmación era mucho más fuerte. La entropía cruzada codifica esa asimetría y el error cuadrático la aplana.
Hay además una razón de optimización. Con sigmoide y error cuadrático, el gradiente contiene la derivada de la sigmoide, que se satura y se hace casi nula cuando la predicción es extrema: el modelo equivocado y seguro deja de aprender. Con entropía cruzada esa derivada se cancela algebraicamente y el gradiente queda (p − y), proporcional al error. La elección de pérdida arregla un problema de gradientes, no solo de interpretación.
Cuatro situaciones, dos funciones de pérdida.
caso p predicha CE MSE
correcto y seguro 0,99 0,01005 0,0001
correcto y dudoso 0,55 0,59784 0,2025
incorrecto y dudoso 0,45 0,79851 0,2025
incorrecto y seguro 0,01 4,60517 0,9801
Razón entre incorrecto-seguro e incorrecto-dudoso:
entropía cruzada: 5,77×
error cuadrático: 3,24×
La entropía cruzada castiga mucho más la seguridad
equivocada, que es exactamente lo que se busca.
Y su gradiente no se satura: (p − y), sin factor σ'.
Cross-entropy penaliza la confianza equivocada de forma no acotada.
python classes/part-14-matematica-de-machine-learning/286-cross-entropy-en-clasificacion/lab.py
compmath run 286
correcto_segurocorrecto_dudosoincorrecto_dudosoincorrecto_segurorazon_CE_seguro_vs_dudosorazon_MSE_seguro_vs_dudosoCE_castiga_mucho_masgradiente_de_CE_con_sigmoid{
"correcto_seguro": {
"p_predicha": 0.99,
"cross_entropy": 0.01005,
"error_cuadratico": 0.0001
},
"correcto_dudoso": {
"p_predicha": 0.55,
"cross_entropy": 0.597837,
"error_cuadratico": 0.2025
},
"incorrecto_dudoso": {
"p_predicha": 0.45,
"cross_entropy": 0.798508,
"error_cuadratico": 0.3025
},
"incorrecto_seguro": {
"p_predicha": 0.01,
"cross_entropy": 4.60517,
"error_cuadratico": 0.9801
},
"razon_CE_seguro_vs_dudoso": 5.7672,
"razon_MSE_seguro_vs_dudoso": 3.24
}
Función de pérdida de todo clasificador, calibración de modelos, entrenamiento de modelos de lenguaje y evaluación probabilística.
Estos algoritmos siguen siendo la línea base honesta contra la que se debe comparar cualquier modelo profundo.
9780262337373 verificado en International ISBN Agency (2026-08-19).