Inicio · Parte 13 — Teoría de la información, señales y series
H(p) = −Σ p(x)·log₂ p(x)
0 ≤ H(p) ≤ log₂ n
H = 0 si es determinista; H = log₂ n si es uniforme
La entropía es la sorpresa esperada: la media de −log p ponderada por las propias probabilidades. Mide la incertidumbre media de una fuente antes de observar su salida, y es el concepto central de toda la teoría.
Su interpretación operativa es la que le da fuerza. El teorema de codificación de fuente de Shannon dice que ningún código sin pérdida puede usar menos de H bits por símbolo en promedio, y que existen códigos que se acercan arbitrariamente a ese límite. No es una cota heurística: es una imposibilidad demostrada.
Los dos extremos son informativos. Una fuente determinista tiene entropía cero: no hace falta transmitir nada porque el receptor ya sabe qué viene. Una fuente uniforme sobre n símbolos tiene entropía log₂ n, la máxima posible: no hay estructura que explotar y no se puede comprimir por debajo de la codificación de longitud fija.
Toda compresión vive entre esos extremos, y explota que las distribuciones reales no son uniformes. En aprendizaje automático la entropía aparece además como medida de incertidumbre de una predicción: una salida softmax casi uniforme tiene entropía alta y el modelo está dudando, lo que sirve como señal para aprendizaje activo o para rechazar la predicción.
Entropía de cuatro distribuciones sobre el mismo alfabeto.
distribución H (bits)
uniforme sobre 4 símbolos 2,0000 ← máxima
sesgada [0,7 ; 0,15 ; 0,1 ; 0,05] 1,2568
moneda justa (2 símbolos) 1,0000
determinista 0,0000 ← mínima
Máximo teórico para 4 símbolos: log₂ 4 = 2,0 ✓
La misma uniforme en nats: ln 4 = 1,3863 nats
Conversión: 1,3863 × 1,4427 = 2,0 bits ✓
Lectura: la fuente sesgada necesita 1,26 bits por símbolo
en el mejor código posible, frente a los 2 de la uniforme.
La entropía es la sorpresa esperada y el límite de compresión.
python classes/part-13-teoria-de-la-informacion-senales-y-series/262-entropia-de-shannon/lab.py
compmath run 262
entropias_bitsmaxima_para_4_simbolosla_uniforme_maximizala_determinista_es_0entropia_en_nats_uniformeinterpretacion{
"entropias_bits": {
"uniforme_4": 2.0,
"sesgada": 1.25678,
"determinista": -0.0,
"moneda_justa": 1.0
},
"maxima_para_4_simbolos": 2.0,
"la_uniforme_maximiza": true,
"la_determinista_es_0": true,
"entropia_en_nats_uniforme": 1.386294,
"interpretacion": "bits medios necesarios por símbolo en el mejor código posible"
}
Compresión de datos, medida de incertidumbre en predicciones, criterio de división en árboles de decisión y aprendizaje activo.
La función de pérdida de casi todo clasificador es entropía cruzada; el VAE optimiza un ELBO con un término KL; las CNN son convoluciones aprendidas.
10.1002/047174882x verificado en Crossref (2026-08-19).10.1002/j.1538-7305.1948.tb01338.x verificado en Crossref (2026-08-19).