🧮 Computational Mathematics

Inicio · Parte 13 — Teoría de la información, señales y series

267 — Principio de máxima entropía

avanzado clase 7 de 20 4 horas demostración max_entropy

Entre todas las distribuciones compatibles con lo que se sabe, elegir la que menos añade.

Fórmulas

maximizar H(p) sujeto a las restricciones conocidas
sin restricciones ⟹ uniforme
media y varianza fijadas ⟹ normal

Desarrollo

El principio de máxima entropía responde a una pregunta de modelado: si solo se conocen algunas propiedades de una distribución, ¿cuál elegir entre todas las compatibles? La respuesta es la de máxima entropía, porque es la que menos supuestos añade a lo que realmente se sabe.

Cualquier otra elección introduce estructura que los datos no respaldan. Elegir una distribución de entropía menor equivale a afirmar que se sabe más de lo que se sabe, y esa información inventada puede sesgar todas las conclusiones posteriores. Es el principio de honestidad epistémica traducido a matemáticas.

Las soluciones bajo distintas restricciones son notablemente reconocibles, y no por casualidad. Sin restricciones sale la uniforme. Fijando media y varianza sale la normal. Fijando solo la media en el semieje positivo sale la exponencial. Las distribuciones «naturales» de la estadística son las de máxima entropía bajo las restricciones más simples.

El resultado más relevante para la inteligencia artificial es que la distribución de máxima entropía sujeta a restricciones lineales tiene forma exponencial, y de ahí sale softmax. La capa de salida de todo clasificador es la distribución de máxima entropía compatible con los logits. Softmax no es una normalización conveniente: es la respuesta a un problema de optimización con restricciones.

Ejemplo trabajado

Tres distribuciones sobre un dado y sus entropías.

candidata               H (bits)     media
uniforme                 2,584963     3,5
sesgada al 6             2,160964     4,5
casi determinista        0,xxx        1,3

Máximo teórico para 6 símbolos: log₂ 6 = 2,584963      ✓

Sin restricciones, gana la uniforme.

Si se supiera que la media es 4,5, la uniforme dejaría de
ser admisible y la de máxima entropía sería una exponencial
truncada, no la sesgada arbitraria.

Con media y varianza fijadas sobre la recta real:
  la distribución de máxima entropía es la normal.

Qué calcula el laboratorio

Principio de máxima entropía: la distribución menos comprometida.

python classes/part-13-teoria-de-la-informacion-senales-y-series/267-principio-de-maxima-entropia/lab.py
compmath run 267

Salidas del laboratorio (7)

Muestra de la ejecución real

{
  "candidatas": {
    "uniforme": 2.584963,
    "sesgada_al_6": 2.160964,
    "casi_determinista": 0.701188
  },
  "medias": {
    "uniforme": 3.5,
    "sesgada_al_6": 4.5,
    "casi_determinista": 1.3
  },
  "maxima_entropia": "uniforme",
  "entropia_maxima_teorica": 2.584963,
  "sin_restricciones_gana_la_uniforme": true,
  "con_media_y_varianza_fijas": "la normal maximiza la entropía"
}

Errores comunes

Dónde se usa

Justificación de softmax, modelos de máxima entropía en procesamiento de lenguaje, elección de priores no informativos y física estadística.

Idea rectora de la parte

Minimizar cross-entropy equivale a maximizar verosimilitud.

Error a evitar

Calcular log(0) sin epsilon de estabilidad.

Conexión con IA

La función de pérdida de casi todo clasificador es entropía cruzada; el VAE optimiza un ELBO con un término KL; las CNN son convoluciones aprendidas.

Bibliografía de la clase

Archivos de la clase