🧮 Computational Mathematics

Inicio · Parte 14 — Matemática de Machine Learning

286 — Cross-entropy en clasificación

ml-avanzado clase 6 de 20 4 horas demostración classification_loss

Estar seguro y equivocado cuesta sin límite con entropía cruzada, y poco con error cuadrático.

Fórmulas

CE = −log p(clase correcta)
MSE = (p − y)²  ≤ 1  siempre
CE → ∞ cuando p → 0

Desarrollo

Comparar entropía cruzada con error cuadrático en clasificación revela por qué la primera es la elección correcta, y la razón es cuantitativa antes que teórica: cómo penalizan la confianza equivocada.

El error cuadrático está acotado. Con probabilidades entre 0 y 1, el error máximo posible es 1, así que un modelo completamente seguro y completamente equivocado recibe una penalización finita y modesta. La entropía cruzada, en cambio, crece sin límite: si la probabilidad asignada a la respuesta correcta tiende a cero, la pérdida tiende a infinito.

Ese comportamiento es exactamente el deseable. Un modelo que dice «99 % seguro» y falla merece un castigo mucho mayor que uno que dice «55 % seguro» y falla, porque la afirmación era mucho más fuerte. La entropía cruzada codifica esa asimetría y el error cuadrático la aplana.

Hay además una razón de optimización. Con sigmoide y error cuadrático, el gradiente contiene la derivada de la sigmoide, que se satura y se hace casi nula cuando la predicción es extrema: el modelo equivocado y seguro deja de aprender. Con entropía cruzada esa derivada se cancela algebraicamente y el gradiente queda (p − y), proporcional al error. La elección de pérdida arregla un problema de gradientes, no solo de interpretación.

Ejemplo trabajado

Cuatro situaciones, dos funciones de pérdida.

caso                    p predicha    CE        MSE
correcto y seguro          0,99     0,01005   0,0001
correcto y dudoso          0,55     0,59784   0,2025
incorrecto y dudoso        0,45     0,79851   0,2025
incorrecto y seguro        0,01     4,60517   0,9801

Razón entre incorrecto-seguro e incorrecto-dudoso:
  entropía cruzada: 5,77×
  error cuadrático: 3,24×

La entropía cruzada castiga mucho más la seguridad
equivocada, que es exactamente lo que se busca.

Y su gradiente no se satura: (p − y), sin factor σ'.

Qué calcula el laboratorio

Cross-entropy penaliza la confianza equivocada de forma no acotada.

python classes/part-14-matematica-de-machine-learning/286-cross-entropy-en-clasificacion/lab.py
compmath run 286

Salidas del laboratorio (8)

Muestra de la ejecución real

{
  "correcto_seguro": {
    "p_predicha": 0.99,
    "cross_entropy": 0.01005,
    "error_cuadratico": 0.0001
  },
  "correcto_dudoso": {
    "p_predicha": 0.55,
    "cross_entropy": 0.597837,
    "error_cuadratico": 0.2025
  },
  "incorrecto_dudoso": {
    "p_predicha": 0.45,
    "cross_entropy": 0.798508,
    "error_cuadratico": 0.3025
  },
  "incorrecto_seguro": {
    "p_predicha": 0.01,
    "cross_entropy": 4.60517,
    "error_cuadratico": 0.9801
  },
  "razon_CE_seguro_vs_dudoso": 5.7672,
  "razon_MSE_seguro_vs_dudoso": 3.24
}

Errores comunes

Dónde se usa

Función de pérdida de todo clasificador, calibración de modelos, entrenamiento de modelos de lenguaje y evaluación probabilística.

Idea rectora de la parte

Cada algoritmo es un objetivo más un método de optimización; nada más.

Error a evitar

Interpretar coeficientes de un modelo con features correlacionadas.

Conexión con IA

Estos algoritmos siguen siendo la línea base honesta contra la que se debe comparar cualquier modelo profundo.

Bibliografía de la clase

Archivos de la clase