🧮 Computational Mathematics

Inicio · Parte 13 — Teoría de la información, señales y series

266 — Información mutua

avanzado clase 6 de 20 4 horas demostración mutual_information

La información mutua vale cero solo si hay independencia, y detecta lo que la correlación no ve.

Fórmulas

I(X;Y) = H(X) − H(X|Y) = H(Y) − H(Y|X)
I(X;Y) = KL(p(x,y) ‖ p(x)·p(y))
I(X;Y) = 0  ⟺  X ⫫ Y

Desarrollo

La información mutua mide cuánto se reduce la incertidumbre sobre una variable al conocer la otra. Es simétrica —saber Y informa sobre X tanto como al revés— y se expresa como la diferencia entre la entropía y la entropía condicional.

Su lectura más profunda es la tercera fórmula: es la divergencia KL entre la distribución conjunta y el producto de las marginales. Como la KL vale cero solo si las distribuciones coinciden, y coincidir con el producto de marginales es la definición de independencia, la información mutua es cero si y solo si las variables son independientes.

Esa equivalencia es lo que la hace superior a la correlación como medida de dependencia. La correlación de la clase 191 solo detecta relaciones lineales, y vale cero para una dependencia cuadrática perfecta. La información mutua detecta cualquier dependencia, lineal o no, monótona o no.

El precio es la estimación. Con variables discretas y datos suficientes se calcula directamente contando; con variables continuas hay que estimar densidades, y eso es difícil en dimensión alta. Los estimadores neuronales como MINE son un área activa, precisamente porque la información mutua aparece en el objetivo del aprendizaje autosupervisado contrastivo.

Ejemplo trabajado

Dos conjuntas con las mismas marginales y dependencia distinta.

Caso dependiente:
  p(0,0)=0,4   p(0,1)=0,1
  p(1,0)=0,1   p(1,1)=0,4

  H(X) = 1,0 bits      H(Y) = 1,0 bits
  I(X;Y) = 0,278072 bits

Caso independiente (mismas marginales):
  p(x,y) = p(x)·p(y) = 0,25 en las cuatro celdas
  I(X;Y) = 0,0                                       ✓

Ventaja sobre la correlación:
  con Y = X² y X simétrica, corr = 0 pero I > 0.
  La información mutua ve la dependencia; la correlación no.

Qué calcula el laboratorio

Información mutua: cuánto reduce Y la incertidumbre de X.

python classes/part-13-teoria-de-la-informacion-senales-y-series/266-informacion-mutua/lab.py
compmath run 266

Salidas del laboratorio (8)

Muestra de la ejecución real

{
  "conjunta_dependiente": {
    "(0, 0)": 0.4,
    "(0, 1)": 0.1,
    "(1, 0)": 0.1,
    "(1, 1)": 0.4
  },
  "H(X)": 1.0,
  "H(Y)": 1.0,
  "I(X;Y)": 0.278072,
  "I_en_el_caso_independiente": 0.0,
  "I=0_sii_independientes": true
}

Errores comunes

Dónde se usa

Selección de características, aprendizaje autosupervisado contrastivo, análisis del cuello de botella de información y registro de imágenes médicas.

Idea rectora de la parte

La entropía es el límite inferior de compresión sin pérdida.

Error a evitar

Muestrear por debajo de Nyquist y culpar al modelo del ruido resultante.

Conexión con IA

La función de pérdida de casi todo clasificador es entropía cruzada; el VAE optimiza un ELBO con un término KL; las CNN son convoluciones aprendidas.

Bibliografía de la clase

Archivos de la clase