🧮 Computational Mathematics

Inicio · Parte 16 — Matemática de Transformers, modelos generativos, grafos y RL

332 — ELBO y variational inference

experto clase 12 de 20 4 horas demostración elbo

El ELBO acota la log-verosimilitud, y la brecha es exactamente otra KL.

Fórmulas

ELBO = E_q[log p(x|z)] − KL(q(z|x) ‖ p(z))
log p(x) = ELBO + KL(q(z|x) ‖ p(z|x))
la brecha es ≥ 0, luego log p(x) ≥ ELBO

Desarrollo

La log-verosimilitud de un modelo con variables latentes requiere integrar sobre todas las configuraciones latentes posibles, y esa integral es intratable salvo en casos triviales. La inferencia variacional sortea el problema optimizando una cota inferior en su lugar.

El ELBO tiene dos términos con lecturas claras. El de reconstrucción premia que el decodificador recupere la entrada a partir del latente. El de KL penaliza que la posterior aproximada se aleje del prior, actuando como regularizador del espacio latente. Maximizar la suma equilibra fidelidad y estructura.

La identidad clave es que log p(x) es exactamente el ELBO más la KL entre la posterior aproximada y la verdadera. Como toda KL es no negativa, el ELBO nunca supera la log-verosimilitud, y maximizarlo hace dos cosas a la vez: sube la verosimilitud y acerca la aproximación a la posterior real. Esa doble acción es lo elegante del método.

El ELBO es también el objeto que aparecía en el algoritmo EM de la clase 296. En EM el paso E hace la cota exacta calculando la posterior verdadera; en inferencia variacional la posterior no es tratable y la cota queda con holgura. Ver EM primero es lo que hace que el ELBO no parezca una construcción sacada de la nada.

Ejemplo trabajado

Descomposición numérica del ELBO.

término de reconstrucción: −12,4
término KL:                  3,7

ELBO = −12,4 − 3,7 = −16,1

Identidad:
  log p(x) = ELBO + KL(q(z|x) ‖ p(z|x))
           = −16,1 + brecha

Como la brecha es ≥ 0:
  log p(x) ≥ −16,1                                   ✓

Si la brecha fuera 0, la posterior aproximada
coincidiría con la verdadera y el ELBO sería exacto.

Maximizar el ELBO sube la verosimilitud y reduce
la brecha simultáneamente.

Qué calcula el laboratorio

ELBO: reconstrucción menos KL, y su relación con la log-verosimilitud.

python classes/part-16-matematica-de-transformers-modelos-generativos-grafos-y-rl/332-elbo-y-variational-inference/lab.py
compmath run 332

Salidas del laboratorio (10)

Muestra de la ejecución real

{
  "formula": "ELBO = E_q[log p(x|z)] - KL(q(z|x) ‖ p(z))",
  "termino_de_reconstruccion": -12.4,
  "termino_KL": 3.7,
  "ELBO": -16.1,
  "log_p(x)_>=_ELBO": true,
  "brecha": "KL(q(z|x) ‖ p(z|x)), siempre ≥ 0"
}

Errores comunes

Dónde se usa

VAE, inferencia variacional en modelos bayesianos, modelos de difusión y aproximaciones tratables de posteriores complejas.

Idea rectora de la parte

La escala 1/√d evita que el producto punto sature la softmax en alta dimensión.

Error a evitar

Normalizar el Laplaciano de un grafo con nodos aislados sin tratar la división por cero.

Conexión con IA

Esta parte es la traducción matemática directa de los papers que definen el estado del arte actual.

Bibliografía de la clase

Archivos de la clase