Inicio · Parte 13 — Teoría de la información, señales y series
maximizar H(p) sujeto a las restricciones conocidas
sin restricciones ⟹ uniforme
media y varianza fijadas ⟹ normal
El principio de máxima entropía responde a una pregunta de modelado: si solo se conocen algunas propiedades de una distribución, ¿cuál elegir entre todas las compatibles? La respuesta es la de máxima entropía, porque es la que menos supuestos añade a lo que realmente se sabe.
Cualquier otra elección introduce estructura que los datos no respaldan. Elegir una distribución de entropía menor equivale a afirmar que se sabe más de lo que se sabe, y esa información inventada puede sesgar todas las conclusiones posteriores. Es el principio de honestidad epistémica traducido a matemáticas.
Las soluciones bajo distintas restricciones son notablemente reconocibles, y no por casualidad. Sin restricciones sale la uniforme. Fijando media y varianza sale la normal. Fijando solo la media en el semieje positivo sale la exponencial. Las distribuciones «naturales» de la estadística son las de máxima entropía bajo las restricciones más simples.
El resultado más relevante para la inteligencia artificial es que la distribución de máxima entropía sujeta a restricciones lineales tiene forma exponencial, y de ahí sale softmax. La capa de salida de todo clasificador es la distribución de máxima entropía compatible con los logits. Softmax no es una normalización conveniente: es la respuesta a un problema de optimización con restricciones.
Tres distribuciones sobre un dado y sus entropías.
candidata H (bits) media
uniforme 2,584963 3,5
sesgada al 6 2,160964 4,5
casi determinista 0,xxx 1,3
Máximo teórico para 6 símbolos: log₂ 6 = 2,584963 ✓
Sin restricciones, gana la uniforme.
Si se supiera que la media es 4,5, la uniforme dejaría de
ser admisible y la de máxima entropía sería una exponencial
truncada, no la sesgada arbitraria.
Con media y varianza fijadas sobre la recta real:
la distribución de máxima entropía es la normal.
Principio de máxima entropía: la distribución menos comprometida.
python classes/part-13-teoria-de-la-informacion-senales-y-series/267-principio-de-maxima-entropia/lab.py
compmath run 267
candidatasmediasmaxima_entropiaentropia_maxima_teoricasin_restricciones_gana_la_uniformecon_media_y_varianza_fijascon_soporte_positivo_y_media_fija{
"candidatas": {
"uniforme": 2.584963,
"sesgada_al_6": 2.160964,
"casi_determinista": 0.701188
},
"medias": {
"uniforme": 3.5,
"sesgada_al_6": 4.5,
"casi_determinista": 1.3
},
"maxima_entropia": "uniforme",
"entropia_maxima_teorica": 2.584963,
"sin_restricciones_gana_la_uniforme": true,
"con_media_y_varianza_fijas": "la normal maximiza la entropía"
}
Justificación de softmax, modelos de máxima entropía en procesamiento de lenguaje, elección de priores no informativos y física estadística.
La función de pérdida de casi todo clasificador es entropía cruzada; el VAE optimiza un ELBO con un término KL; las CNN son convoluciones aprendidas.
10.1103/physrev.106.620 verificado en Crossref (2026-08-19).10.1002/047174882x verificado en Crossref (2026-08-19).