🧮 Computational Mathematics

Inicio · Parte 13 — Teoría de la información, señales y series

261 — Información y sorpresa

avanzado clase 1 de 20 4 horas demostración surprise

La información de un evento es su sorpresa, y el logaritmo la hace aditiva.

Fórmulas

I(x) = −log₂ p(x)   en bits
p = 1  ⟹  I = 0;   p → 0  ⟹  I → ∞
eventos independientes: I(x,y) = I(x) + I(y)

Desarrollo

Antes de definir entropía hay que definir cuánta información aporta un solo evento. La respuesta de Shannon es que la información es sorpresa: enterarse de algo que ya se daba por seguro no aporta nada, y enterarse de algo improbable aporta mucho.

La función que cumple eso es −log p. Vale cero cuando p = 1 y tiende a infinito cuando p tiende a cero, con la forma correcta. Y no es una elección arbitraria: es la única función continua que satisface la propiedad de aditividad, salvo un factor de escala.

La aditividad es la exigencia clave. Si dos eventos son independientes, la información de observar ambos debe ser la suma de las informaciones individuales. Como las probabilidades se multiplican y los logaritmos convierten productos en sumas, el logaritmo es la única vía. Es la misma razón por la que se trabaja con log-verosimilitud.

La base del logaritmo fija la unidad. Con base 2 la información se mide en bits, y un bit es exactamente la información de un lanzamiento de moneda justa. Con logaritmo natural se mide en nats, y es lo habitual en aprendizaje automático porque su derivada es más limpia. Comparar entropías calculadas en bases distintas sin convertir es un error frecuente: el factor es 1,4427.

Ejemplo trabajado

Sorpresa de cuatro eventos con probabilidades muy distintas.

evento          p          I = −log₂ p
casi seguro    0,99          0,0145 bits
frecuente      0,50          1,0000 bits
raro           0,01          6,6439 bits
rarísimo       0,001         9,9658 bits

Un evento de p = 1 aporta exactamente 0 bits.

Aditividad: dos lanzamientos independientes de moneda
  I(cara, cara) = −log₂(0,25) = 2,0 bits
  I(cara) + I(cara) = 1,0 + 1,0 = 2,0 bits            ✓

Conversión de unidades:
  1 nat = 1,4427 bits        1 bit = 0,6931 nats

Qué calcula el laboratorio

La sorpresa de un evento es -log de su probabilidad.

python classes/part-13-teoria-de-la-informacion-senales-y-series/261-informacion-y-sorpresa/lab.py
compmath run 261

Salidas del laboratorio (6)

Muestra de la ejecución real

{
  "sorpresa_en_bits": {
    "casi_seguro": 0.0145,
    "frecuente": 1.0,
    "raro": 6.643856,
    "rarisimo": 13.287712
  },
  "un_evento_de_p=1_no_sorprende": -0.0,
  "aditiva_para_independientes": 2.0,
  "suma_de_sorpresas": 2.0,
  "por_que_logaritmo": "convierte productos de probabilidades en sumas de información",
  "unidad": "bits con log₂, nats con ln"
}

Errores comunes

Dónde se usa

Diseño de códigos, medida de sorpresa de un modelo ante datos nuevos, detección de anomalías y cuantificación de la incertidumbre de una predicción.

Idea rectora de la parte

La entropía es el límite inferior de compresión sin pérdida.

Error a evitar

Calcular log(0) sin epsilon de estabilidad.

Conexión con IA

La función de pérdida de casi todo clasificador es entropía cruzada; el VAE optimiza un ELBO con un término KL; las CNN son convoluciones aprendidas.

Bibliografía de la clase

Archivos de la clase