Inicio · Parte 13 — Teoría de la información, señales y series
I(x) = −log₂ p(x) en bits
p = 1 ⟹ I = 0; p → 0 ⟹ I → ∞
eventos independientes: I(x,y) = I(x) + I(y)
Antes de definir entropía hay que definir cuánta información aporta un solo evento. La respuesta de Shannon es que la información es sorpresa: enterarse de algo que ya se daba por seguro no aporta nada, y enterarse de algo improbable aporta mucho.
La función que cumple eso es −log p. Vale cero cuando p = 1 y tiende a infinito cuando p tiende a cero, con la forma correcta. Y no es una elección arbitraria: es la única función continua que satisface la propiedad de aditividad, salvo un factor de escala.
La aditividad es la exigencia clave. Si dos eventos son independientes, la información de observar ambos debe ser la suma de las informaciones individuales. Como las probabilidades se multiplican y los logaritmos convierten productos en sumas, el logaritmo es la única vía. Es la misma razón por la que se trabaja con log-verosimilitud.
La base del logaritmo fija la unidad. Con base 2 la información se mide en bits, y un bit es exactamente la información de un lanzamiento de moneda justa. Con logaritmo natural se mide en nats, y es lo habitual en aprendizaje automático porque su derivada es más limpia. Comparar entropías calculadas en bases distintas sin convertir es un error frecuente: el factor es 1,4427.
Sorpresa de cuatro eventos con probabilidades muy distintas.
evento p I = −log₂ p
casi seguro 0,99 0,0145 bits
frecuente 0,50 1,0000 bits
raro 0,01 6,6439 bits
rarísimo 0,001 9,9658 bits
Un evento de p = 1 aporta exactamente 0 bits.
Aditividad: dos lanzamientos independientes de moneda
I(cara, cara) = −log₂(0,25) = 2,0 bits
I(cara) + I(cara) = 1,0 + 1,0 = 2,0 bits ✓
Conversión de unidades:
1 nat = 1,4427 bits 1 bit = 0,6931 nats
La sorpresa de un evento es -log de su probabilidad.
python classes/part-13-teoria-de-la-informacion-senales-y-series/261-informacion-y-sorpresa/lab.py
compmath run 261
sorpresa_en_bitsun_evento_de_p=1_no_sorprendeaditiva_para_independientessuma_de_sorpresaspor_que_logaritmounidad{
"sorpresa_en_bits": {
"casi_seguro": 0.0145,
"frecuente": 1.0,
"raro": 6.643856,
"rarisimo": 13.287712
},
"un_evento_de_p=1_no_sorprende": -0.0,
"aditiva_para_independientes": 2.0,
"suma_de_sorpresas": 2.0,
"por_que_logaritmo": "convierte productos de probabilidades en sumas de información",
"unidad": "bits con log₂, nats con ln"
}
Diseño de códigos, medida de sorpresa de un modelo ante datos nuevos, detección de anomalías y cuantificación de la incertidumbre de una predicción.
La función de pérdida de casi todo clasificador es entropía cruzada; el VAE optimiza un ELBO con un término KL; las CNN son convoluciones aprendidas.
10.1002/j.1538-7305.1948.tb01338.x verificado en Crossref (2026-08-19).