Inicio · Parte 16 — Matemática de Transformers, modelos generativos, grafos y RL
∇J = E[∇log π(a|s) · (R − b)]
b es la línea base, típicamente el valor medio
restar b no sesga el gradiente
Los métodos de gradiente de política optimizan directamente la política parametrizada, sin pasar por una función de valor. La actualización tiene una lectura muy directa: aumentar la log-probabilidad de las acciones que produjeron recompensa alta y disminuir la de las que produjeron recompensa baja.
El problema del estimador básico es la varianza. La recompensa de un episodio depende de muchas decisiones y de la aleatoriedad del entorno, así que el gradiente es muy ruidoso y el aprendizaje, lento e inestable.
La línea base lo mitiga. Restar una cantidad que no depende de la acción —típicamente el valor medio del estado— no cambia la esperanza del gradiente pero reduce mucho su varianza. Es un resultado limpio: se gana estabilidad sin introducir sesgo. La diferencia R − b se llama ventaja, y mide cuánto mejor fue la acción que la media.
De ahí sale toda la familia actor-crítico: el actor es la política, el crítico estima la línea base, y ambos se entrenan a la vez. PPO, el algoritmo estándar hoy y el que se usa en el ajuste por retroalimentación humana de los modelos de lenguaje, es un refinamiento de esta idea con una restricción que impide que la política cambie demasiado en un solo paso.
REINFORCE sobre un bandido de tres brazos.
probabilidades reales de recompensa: [0,2 ; 0,5 ; 0,8]
mejor brazo: 2
episodio política línea base
1 [0,3222 ; 0,3222 ; 0,3557] 0,00
100 [ ... ] ...
final [0,004018 ; 0,014253 ; 0,981729]
brazo preferido: 2 ✓
La política converge al brazo correcto sin conocer
las probabilidades: solo por experiencia.
Sin línea base, la varianza del gradiente sería
mucho mayor y la convergencia más lenta.
REINFORCE: gradiente de la política sobre un bandido de 3 brazos.
python classes/part-16-matematica-de-transformers-modelos-generativos-grafos-y-rl/339-policy-gradients/lab.py
compmath run 339
brazosprobabilidades_reales_de_recompensamejor_brazohistorialpolitica_finalbrazo_preferidoencuentra_el_mejorgradientepor_que_la_baselineepisodiossemilla{
"brazos": 3,
"probabilidades_reales_de_recompensa": [
0.2,
0.5,
0.8
],
"mejor_brazo": 2,
"historial": [
{
"episodio": 1,
"politica": [
0.3222,
0.3222,
0.3557
],
"baseline": 0.01
},
{
"episodio": 100,
"politica": [
0.1172,
0.1366,
0.7462
],
"baseline": 0.3862
},
{
"episodio": 500,
"politica": [
0.0105,
0.0304,
0.9591
],
"baseline": 0.7981
},
{
"episodio": 1000,
"politica": [
0.004,
0.0143,
0.9817
],
"baseline": 0.7995
}
],
"politica_final": [
0.004018,
0.014253,
0.981729
],
"brazo_preferido": 2
}
Aprendizaje por refuerzo, RLHF en modelos de lenguaje, robótica, optimización de sistemas de diálogo y control continuo.
Esta parte es la traducción matemática directa de los papers que definen el estado del arte actual.
10.1007/bf00992696 verificado en Crossref (2026-08-19).10.48550/arxiv.1707.06347 verificado en DataCite (2026-08-19).