🧮 Computational Mathematics

Inicio · Parte 16 — Matemática de Transformers, modelos generativos, grafos y RL

339 — Policy gradients

experto clase 19 de 20 4 horas demostración policy_gradients

REINFORCE sube la probabilidad de lo que salió bien, y la línea base reduce la varianza.

Fórmulas

∇J = E[∇log π(a|s) · (R − b)]
b es la línea base, típicamente el valor medio
restar b no sesga el gradiente

Desarrollo

Los métodos de gradiente de política optimizan directamente la política parametrizada, sin pasar por una función de valor. La actualización tiene una lectura muy directa: aumentar la log-probabilidad de las acciones que produjeron recompensa alta y disminuir la de las que produjeron recompensa baja.

El problema del estimador básico es la varianza. La recompensa de un episodio depende de muchas decisiones y de la aleatoriedad del entorno, así que el gradiente es muy ruidoso y el aprendizaje, lento e inestable.

La línea base lo mitiga. Restar una cantidad que no depende de la acción —típicamente el valor medio del estado— no cambia la esperanza del gradiente pero reduce mucho su varianza. Es un resultado limpio: se gana estabilidad sin introducir sesgo. La diferencia R − b se llama ventaja, y mide cuánto mejor fue la acción que la media.

De ahí sale toda la familia actor-crítico: el actor es la política, el crítico estima la línea base, y ambos se entrenan a la vez. PPO, el algoritmo estándar hoy y el que se usa en el ajuste por retroalimentación humana de los modelos de lenguaje, es un refinamiento de esta idea con una restricción que impide que la política cambie demasiado en un solo paso.

Ejemplo trabajado

REINFORCE sobre un bandido de tres brazos.

probabilidades reales de recompensa: [0,2 ; 0,5 ; 0,8]
mejor brazo: 2

episodio    política                    línea base
   1      [0,3222 ; 0,3222 ; 0,3557]      0,00
 100      [ ... ]                          ...
final     [0,004018 ; 0,014253 ; 0,981729]

brazo preferido: 2                                   ✓

La política converge al brazo correcto sin conocer
las probabilidades: solo por experiencia.

Sin línea base, la varianza del gradiente sería
mucho mayor y la convergencia más lenta.

Qué calcula el laboratorio

REINFORCE: gradiente de la política sobre un bandido de 3 brazos.

python classes/part-16-matematica-de-transformers-modelos-generativos-grafos-y-rl/339-policy-gradients/lab.py
compmath run 339

Salidas del laboratorio (11)

Muestra de la ejecución real

{
  "brazos": 3,
  "probabilidades_reales_de_recompensa": [
    0.2,
    0.5,
    0.8
  ],
  "mejor_brazo": 2,
  "historial": [
    {
      "episodio": 1,
      "politica": [
        0.3222,
        0.3222,
        0.3557
      ],
      "baseline": 0.01
    },
    {
      "episodio": 100,
      "politica": [
        0.1172,
        0.1366,
        0.7462
      ],
      "baseline": 0.3862
    },
    {
      "episodio": 500,
      "politica": [
        0.0105,
        0.0304,
        0.9591
      ],
      "baseline": 0.7981
    },
    {
      "episodio": 1000,
      "politica": [
        0.004,
        0.0143,
        0.9817
      ],
      "baseline": 0.7995
    }
  ],
  "politica_final": [
    0.004018,
    0.014253,
    0.981729
  ],
  "brazo_preferido": 2
}

Errores comunes

Dónde se usa

Aprendizaje por refuerzo, RLHF en modelos de lenguaje, robótica, optimización de sistemas de diálogo y control continuo.

Idea rectora de la parte

El ELBO acota inferiormente la log-verosimilitud con un término de reconstrucción y uno KL.

Error a evitar

Olvidar la máscara causal en el modelado autoregresivo.

Conexión con IA

Esta parte es la traducción matemática directa de los papers que definen el estado del arte actual.

Bibliografía de la clase

Archivos de la clase