Inicio · Parte 13 — Teoría de la información, señales y series
I(X;Y) = H(X) − H(X|Y) = H(Y) − H(Y|X)
I(X;Y) = KL(p(x,y) ‖ p(x)·p(y))
I(X;Y) = 0 ⟺ X ⫫ Y
La información mutua mide cuánto se reduce la incertidumbre sobre una variable al conocer la otra. Es simétrica —saber Y informa sobre X tanto como al revés— y se expresa como la diferencia entre la entropía y la entropía condicional.
Su lectura más profunda es la tercera fórmula: es la divergencia KL entre la distribución conjunta y el producto de las marginales. Como la KL vale cero solo si las distribuciones coinciden, y coincidir con el producto de marginales es la definición de independencia, la información mutua es cero si y solo si las variables son independientes.
Esa equivalencia es lo que la hace superior a la correlación como medida de dependencia. La correlación de la clase 191 solo detecta relaciones lineales, y vale cero para una dependencia cuadrática perfecta. La información mutua detecta cualquier dependencia, lineal o no, monótona o no.
El precio es la estimación. Con variables discretas y datos suficientes se calcula directamente contando; con variables continuas hay que estimar densidades, y eso es difícil en dimensión alta. Los estimadores neuronales como MINE son un área activa, precisamente porque la información mutua aparece en el objetivo del aprendizaje autosupervisado contrastivo.
Dos conjuntas con las mismas marginales y dependencia distinta.
Caso dependiente:
p(0,0)=0,4 p(0,1)=0,1
p(1,0)=0,1 p(1,1)=0,4
H(X) = 1,0 bits H(Y) = 1,0 bits
I(X;Y) = 0,278072 bits
Caso independiente (mismas marginales):
p(x,y) = p(x)·p(y) = 0,25 en las cuatro celdas
I(X;Y) = 0,0 ✓
Ventaja sobre la correlación:
con Y = X² y X simétrica, corr = 0 pero I > 0.
La información mutua ve la dependencia; la correlación no.
Información mutua: cuánto reduce Y la incertidumbre de X.
python classes/part-13-teoria-de-la-informacion-senales-y-series/266-informacion-mutua/lab.py
compmath run 266
conjunta_dependienteH(X)H(Y)I(X;Y)I_en_el_caso_independienteI=0_sii_independientesI(X;Y)=H(X)-H(X|Y)detecta_relaciones_no_lineales{
"conjunta_dependiente": {
"(0, 0)": 0.4,
"(0, 1)": 0.1,
"(1, 0)": 0.1,
"(1, 1)": 0.4
},
"H(X)": 1.0,
"H(Y)": 1.0,
"I(X;Y)": 0.278072,
"I_en_el_caso_independiente": 0.0,
"I=0_sii_independientes": true
}
Selección de características, aprendizaje autosupervisado contrastivo, análisis del cuello de botella de información y registro de imágenes médicas.
La función de pérdida de casi todo clasificador es entropía cruzada; el VAE optimiza un ELBO con un término KL; las CNN son convoluciones aprendidas.
10.1002/047174882x verificado en Crossref (2026-08-19).10.48550/arxiv.1801.04062 verificado en DataCite (2026-08-19).