🧮 Computational Mathematics

Inicio · Parte 13 — Teoría de la información, señales y series

262 — Entropía de Shannon

avanzado clase 2 de 20 4 horas demostración shannon_entropy

La entropía es el número mínimo de bits por símbolo que cualquier compresor puede lograr.

Fórmulas

H(p) = −Σ p(x)·log₂ p(x)
0 ≤ H(p) ≤ log₂ n
H = 0 si es determinista;  H = log₂ n si es uniforme

Desarrollo

La entropía es la sorpresa esperada: la media de −log p ponderada por las propias probabilidades. Mide la incertidumbre media de una fuente antes de observar su salida, y es el concepto central de toda la teoría.

Su interpretación operativa es la que le da fuerza. El teorema de codificación de fuente de Shannon dice que ningún código sin pérdida puede usar menos de H bits por símbolo en promedio, y que existen códigos que se acercan arbitrariamente a ese límite. No es una cota heurística: es una imposibilidad demostrada.

Los dos extremos son informativos. Una fuente determinista tiene entropía cero: no hace falta transmitir nada porque el receptor ya sabe qué viene. Una fuente uniforme sobre n símbolos tiene entropía log₂ n, la máxima posible: no hay estructura que explotar y no se puede comprimir por debajo de la codificación de longitud fija.

Toda compresión vive entre esos extremos, y explota que las distribuciones reales no son uniformes. En aprendizaje automático la entropía aparece además como medida de incertidumbre de una predicción: una salida softmax casi uniforme tiene entropía alta y el modelo está dudando, lo que sirve como señal para aprendizaje activo o para rechazar la predicción.

Ejemplo trabajado

Entropía de cuatro distribuciones sobre el mismo alfabeto.

distribución                        H (bits)
uniforme sobre 4 símbolos            2,0000    ← máxima
sesgada [0,7 ; 0,15 ; 0,1 ; 0,05]    1,2568
moneda justa (2 símbolos)            1,0000
determinista                         0,0000    ← mínima

Máximo teórico para 4 símbolos: log₂ 4 = 2,0     ✓

La misma uniforme en nats: ln 4 = 1,3863 nats
Conversión: 1,3863 × 1,4427 = 2,0 bits           ✓

Lectura: la fuente sesgada necesita 1,26 bits por símbolo
en el mejor código posible, frente a los 2 de la uniforme.

Qué calcula el laboratorio

La entropía es la sorpresa esperada y el límite de compresión.

python classes/part-13-teoria-de-la-informacion-senales-y-series/262-entropia-de-shannon/lab.py
compmath run 262

Salidas del laboratorio (6)

Muestra de la ejecución real

{
  "entropias_bits": {
    "uniforme_4": 2.0,
    "sesgada": 1.25678,
    "determinista": -0.0,
    "moneda_justa": 1.0
  },
  "maxima_para_4_simbolos": 2.0,
  "la_uniforme_maximiza": true,
  "la_determinista_es_0": true,
  "entropia_en_nats_uniforme": 1.386294,
  "interpretacion": "bits medios necesarios por símbolo en el mejor código posible"
}

Errores comunes

Dónde se usa

Compresión de datos, medida de incertidumbre en predicciones, criterio de división en árboles de decisión y aprendizaje activo.

Idea rectora de la parte

Minimizar cross-entropy equivale a maximizar verosimilitud.

Error a evitar

Comparar entropías calculadas en bases logarítmicas distintas.

Conexión con IA

La función de pérdida de casi todo clasificador es entropía cruzada; el VAE optimiza un ELBO con un término KL; las CNN son convoluciones aprendidas.

Bibliografía de la clase

Archivos de la clase