Inicio · Parte 17 — Frontera matemática para IA e investigación
minimizar KL(q ‖ p) sobre la familia variacional
equivale a maximizar el ELBO
el resultado depende de la familia elegida
La inferencia variacional plantea la aproximación de una posterior como un problema de optimización: elegir una familia de distribuciones tratables y buscar dentro de ella la que minimiza la divergencia KL respecto de la posterior real. Sustituye muestrear por minimizar.
La ventaja es la velocidad y la escala. Donde MCMC necesita miles de evaluaciones secuenciales, la inferencia variacional aprovecha descenso de gradiente, minilotes y GPU. Es lo que hace viable la inferencia bayesiana en modelos con millones de parámetros, y es la razón de que el VAE de la clase 331 funcione.
El precio es un sesgo sistemático. Como se minimiza KL(q‖p) —la dirección de búsqueda de modo, según la clase 264— la aproximación tiende a subestimar la varianza y a concentrarse en un modo. MCMC es asintóticamente exacto; la inferencia variacional es rápida y sesgada, y ese sesgo no desaparece con más cómputo.
La elección de familia determina el resultado. La aproximación de campo medio, que supone independencia entre parámetros, es la más común y la que peor captura correlaciones posteriores. Familias más expresivas —flujos normalizadores— reducen el sesgo a cambio de coste. El criterio práctico es claro: MCMC cuando el modelo es pequeño y la exactitud importa; variacional cuando el modelo es grande y la escala manda.
Aproximación variacional de una posterior normal.
posterior real: Normal(mu = 3,0 ; sigma = 0,8)
familia variacional: Normal(m, s)
paso m s KL
1 0,46875 0,945303 5,03687513
…
final 3,00000 0,800000 ≈ 0
La familia contiene la posterior real, así que
la aproximación es exacta y KL llega a 0. ✓
En un caso real la familia NO contiene la posterior,
y KL se estanca en un valor positivo: ese residuo
es el sesgo del método.
Con campo medio, s quedaría por debajo del real:
la varianza se subestima sistemáticamente.
Inferencia variacional: optimizar en lugar de muestrear.
python classes/part-17-frontera-matematica-para-ia-e-investigacion/345-variational-inference-avanzada/lab.py
compmath run 345
posterior_realfamilia_variacionalhistorialsolucionKL_finalconverge_al_posteriorVI_es_optimizacionsesgomean_field{
"posterior_real": {
"mu": 3.0,
"sigma": 0.8
},
"familia_variacional": "Normal(m, s)",
"historial": [
{
"paso": 1,
"m": 0.46875,
"s": 0.945303,
"KL": 5.03687513
},
{
"paso": 50,
"m": 2.999387,
"s": 0.800002,
"KL": 2.9e-07
},
{
"paso": 150,
"m": 3.0,
"s": 0.8,
"KL": -0.0
},
{
"paso": 400,
"m": 3.0,
"s": 0.8,
"KL": -0.0
}
],
"solucion": {
"m": 3.0,
"s": 0.8
},
"KL_final": -0.0,
"converge_al_posterior": true
}
VAE, redes bayesianas a escala, topic models, inferencia en modelos grandes y cuantificación rápida de incertidumbre.
Score matching fundamenta los modelos de difusión; el transporte óptimo aparece en flow matching; la teoría estadística del aprendizaje explica el scaling.
10.48550/arxiv.1601.00670 verificado en DataCite (2026-08-19).10.48550/arxiv.1505.05770 verificado en DataCite (2026-08-19).