🧮 Computational Mathematics

Inicio · Parte 17 — Frontera matemática para IA e investigación

345 — Variational inference avanzada

frontera-investigacion clase 5 de 20 4 horas demostración advanced_variational_inference

Cambiar muestreo por optimización: más rápido, aproximado y con sesgo conocido.

Fórmulas

minimizar KL(q ‖ p) sobre la familia variacional
equivale a maximizar el ELBO
el resultado depende de la familia elegida

Desarrollo

La inferencia variacional plantea la aproximación de una posterior como un problema de optimización: elegir una familia de distribuciones tratables y buscar dentro de ella la que minimiza la divergencia KL respecto de la posterior real. Sustituye muestrear por minimizar.

La ventaja es la velocidad y la escala. Donde MCMC necesita miles de evaluaciones secuenciales, la inferencia variacional aprovecha descenso de gradiente, minilotes y GPU. Es lo que hace viable la inferencia bayesiana en modelos con millones de parámetros, y es la razón de que el VAE de la clase 331 funcione.

El precio es un sesgo sistemático. Como se minimiza KL(q‖p) —la dirección de búsqueda de modo, según la clase 264— la aproximación tiende a subestimar la varianza y a concentrarse en un modo. MCMC es asintóticamente exacto; la inferencia variacional es rápida y sesgada, y ese sesgo no desaparece con más cómputo.

La elección de familia determina el resultado. La aproximación de campo medio, que supone independencia entre parámetros, es la más común y la que peor captura correlaciones posteriores. Familias más expresivas —flujos normalizadores— reducen el sesgo a cambio de coste. El criterio práctico es claro: MCMC cuando el modelo es pequeño y la exactitud importa; variacional cuando el modelo es grande y la escala manda.

Ejemplo trabajado

Aproximación variacional de una posterior normal.

posterior real: Normal(mu = 3,0 ; sigma = 0,8)
familia variacional: Normal(m, s)

paso     m         s         KL
  1    0,46875   0,945303   5,03687513
  …
final  3,00000   0,800000   ≈ 0

La familia contiene la posterior real, así que
la aproximación es exacta y KL llega a 0.        ✓

En un caso real la familia NO contiene la posterior,
y KL se estanca en un valor positivo: ese residuo
es el sesgo del método.

Con campo medio, s quedaría por debajo del real:
la varianza se subestima sistemáticamente.

Qué calcula el laboratorio

Inferencia variacional: optimizar en lugar de muestrear.

python classes/part-17-frontera-matematica-para-ia-e-investigacion/345-variational-inference-avanzada/lab.py
compmath run 345

Salidas del laboratorio (9)

Muestra de la ejecución real

{
  "posterior_real": {
    "mu": 3.0,
    "sigma": 0.8
  },
  "familia_variacional": "Normal(m, s)",
  "historial": [
    {
      "paso": 1,
      "m": 0.46875,
      "s": 0.945303,
      "KL": 5.03687513
    },
    {
      "paso": 50,
      "m": 2.999387,
      "s": 0.800002,
      "KL": 2.9e-07
    },
    {
      "paso": 150,
      "m": 3.0,
      "s": 0.8,
      "KL": -0.0
    },
    {
      "paso": 400,
      "m": 3.0,
      "s": 0.8,
      "KL": -0.0
    }
  ],
  "solucion": {
    "m": 3.0,
    "s": 0.8
  },
  "KL_final": -0.0,
  "converge_al_posterior": true
}

Errores comunes

Dónde se usa

VAE, redes bayesianas a escala, topic models, inferencia en modelos grandes y cuantificación rápida de incertidumbre.

Idea rectora de la parte

Las cotas PAC acotan el error esperado, no garantizan el error observado.

Error a evitar

Invertir una matriz de covarianza sin jitter numérico.

Conexión con IA

Score matching fundamenta los modelos de difusión; el transporte óptimo aparece en flow matching; la teoría estadística del aprendizaje explica el scaling.

Bibliografía de la clase

Archivos de la clase