Inicio · Parte 16 — Matemática de Transformers, modelos generativos, grafos y RL
ELBO = E_q[log p(x|z)] − KL(q(z|x) ‖ p(z))
log p(x) = ELBO + KL(q(z|x) ‖ p(z|x))
la brecha es ≥ 0, luego log p(x) ≥ ELBO
La log-verosimilitud de un modelo con variables latentes requiere integrar sobre todas las configuraciones latentes posibles, y esa integral es intratable salvo en casos triviales. La inferencia variacional sortea el problema optimizando una cota inferior en su lugar.
El ELBO tiene dos términos con lecturas claras. El de reconstrucción premia que el decodificador recupere la entrada a partir del latente. El de KL penaliza que la posterior aproximada se aleje del prior, actuando como regularizador del espacio latente. Maximizar la suma equilibra fidelidad y estructura.
La identidad clave es que log p(x) es exactamente el ELBO más la KL entre la posterior aproximada y la verdadera. Como toda KL es no negativa, el ELBO nunca supera la log-verosimilitud, y maximizarlo hace dos cosas a la vez: sube la verosimilitud y acerca la aproximación a la posterior real. Esa doble acción es lo elegante del método.
El ELBO es también el objeto que aparecía en el algoritmo EM de la clase 296. En EM el paso E hace la cota exacta calculando la posterior verdadera; en inferencia variacional la posterior no es tratable y la cota queda con holgura. Ver EM primero es lo que hace que el ELBO no parezca una construcción sacada de la nada.
Descomposición numérica del ELBO.
término de reconstrucción: −12,4
término KL: 3,7
ELBO = −12,4 − 3,7 = −16,1
Identidad:
log p(x) = ELBO + KL(q(z|x) ‖ p(z|x))
= −16,1 + brecha
Como la brecha es ≥ 0:
log p(x) ≥ −16,1 ✓
Si la brecha fuera 0, la posterior aproximada
coincidiría con la verdadera y el ELBO sería exacto.
Maximizar el ELBO sube la verosimilitud y reduce
la brecha simultáneamente.
ELBO: reconstrucción menos KL, y su relación con la log-verosimilitud.
python classes/part-16-matematica-de-transformers-modelos-generativos-grafos-y-rl/332-elbo-y-variational-inference/lab.py
compmath run 332
formulatermino_de_reconstrucciontermino_KLELBOlog_p(x)_>=_ELBObrechamaximizar_ELBObeta_VAEbeta_altobeta_cero{
"formula": "ELBO = E_q[log p(x|z)] - KL(q(z|x) ‖ p(z))",
"termino_de_reconstruccion": -12.4,
"termino_KL": 3.7,
"ELBO": -16.1,
"log_p(x)_>=_ELBO": true,
"brecha": "KL(q(z|x) ‖ p(z|x)), siempre ≥ 0"
}
VAE, inferencia variacional en modelos bayesianos, modelos de difusión y aproximaciones tratables de posteriores complejas.
Esta parte es la traducción matemática directa de los papers que definen el estado del arte actual.
10.48550/arxiv.1601.00670 verificado en DataCite (2026-08-19).10.48550/arxiv.1906.02691 verificado en DataCite (2026-08-19).