P27 — AlphaGo

Ruta de agentes · Une las dos tradiciones que el programa enseña por separado: la búsqueda simbólica de la parte 01 y el aprendizaje profundo de la parte 04.

Nivel: L4 · Motor: alphago · Notebook: P27_alphago.ipynb · Anexo: complejidad y coste

1. Identificación

Campo Valor
Título original Mastering the game of Go with deep neural networks and tree search
Autoría David Silver, Aja Huang, Chris J. Maddison y otros (DeepMind)
Año 2016
Venue Nature 529, 484–489
Fuente primaria doi.org/10.1038/nature16961
Acceso Restringido (revista de suscripción)
Fecha de consulta 2026-08-16

2. Problema anterior

El ajedrez cayó en 1997 con búsqueda y una función de evaluación escrita por expertos. El go resistió veinte años más por dos razones concretas: su factor de ramificación es un orden de magnitud mayor, y nadie sabía escribir una función que dijera si una posición es buena.

La búsqueda de Monte Carlo en árbol había mejorado el nivel, pero seguía lejos del profesional. El cuello de botella era doble: demasiadas jugadas que considerar (anchura) y partidas demasiado largas para simular hasta el final (profundidad).

3. Propuesta

Atacar cada dimensión con una red:

Ninguna de las tres piezas basta sola, y el título del paper nombra las dos familias: redes profundas y búsqueda en árbol.

4. Intuición sin fórmulas

Un buen jugador no calcula todas las jugadas: su intuición descarta casi todo y solo analiza a fondo tres o cuatro. AlphaGo hace exactamente eso — la red da la intuición, la búsqueda hace el análisis.

Dónde deja de funcionar la analogía: la intuición humana viene de entender el juego; la de la red viene de correlaciones sobre millones de posiciones. Que el resultado se parezca no implica que el proceso lo haga.

5. Matemática mínima

Selección en el árbol (variante de UCT):
    a* = argmax_a [ Q(s,a) + u(s,a) ]        con  u(s,a) ∝ P(s,a) / (1 + N(s,a))

    Q(s,a) = valor medio observado en las simulaciones que pasaron por (s,a)
    P(s,a) = prior de la red de políticas   ← concentra el presupuesto
    N(s,a) = visitas                        ← penaliza lo ya explorado

Evaluación de una hoja: mezcla de la red de valor y de un despliegue rápido
    V(s) = (1−λ)·v_θ(s) + λ·z_despliegue

El término u decae con las visitas: al principio manda el prior, y conforme se acumula evidencia manda Q. Es el compromiso explorar/explotar de DQN, ahora dentro del árbol.

💡 Consejo

Puente matemático. Esta sección da por sabido lo siguiente. Si algo no te suena, léelo primero: está explicado una sola vez, en un solo sitio, y sirve para todas las fichas.

Dónde Qué necesitas de ahí
A02 §1 · Softmax el softmax de la red de política, que da la prior de la búsqueda
A03 §6 · Gradiente de política (REINFORCE) el gradiente de política con el que se refina jugando

6. Arquitectura o flujo

flowchart TD
    S["♟️ posición"] --> P["🧠 red de políticas<br/>propone jugadas"]
    P -->|"prior P(s,a)<br/>REDUCE LA ANCHURA"| M["🌳 MCTS"]
    M --> L["hoja del árbol"]
    L --> V["🧠 red de valor<br/>¿quién va ganando?"]
    L --> R["despliegue rápido"]
    V -->|"REDUCE LA PROFUNDIDAD"| M
    R --> M
    M --> D["🎯 jugada elegida"]
    D -.->|"autojuego genera<br/>datos nuevos"| P

7. Qué observar en el paper original

8. Evidencia y resultados

Victoria por 5-0 frente al campeón europeo Fan Hui, y una tasa de victoria muy alta frente a los mejores programas de go de la época.

Las tasas de victoria por configuración, las ablaciones y los detalles del hardware están en el artículo y su material suplementario. Verificarlos allí. El match posterior contra Lee Sedol (2016) es un hecho ampliamente documentado pero no forma parte de este artículo.

La miniatura de este eje aísla el mecanismo en tres en raya: el prior propone por preferencia fija, la búsqueda estima un valor por casilla. Ambas aciertan el tipo de jugada, pero solo la segunda produce números comparables y auditables, y solo la segunda mejora con más presupuesto.

9. Impacto

10. Limitaciones

  1. Requiere un simulador perfecto: reglas conocidas, estado completamente observable y posibilidad de simular millones de partidas. Casi ningún problema real cumple eso.
  2. Coste computacional enorme, tanto de entrenamiento como de juego.
  3. Dominio único: no transfiere a otro juego sin rehacer el proceso.
  4. Depende de partidas humanas en esta versión (AlphaGo Zero lo corregirá).
  5. Información perfecta: no cubre juegos con azar u ocultación.
  6. No explica sus decisiones: la jugada sale de un recuento de simulaciones, no de un argumento.

11. Errores comunes

Error Corrección
«Una red neuronal venció al campeón» La red sola no vence a nadie. El título nombra las dos piezas: redes y búsqueda.
«AlphaGo aprendió solo» Esta versión parte de partidas humanas. La que aprende sola es AlphaGo Zero (2017).
«Demuestra que la IA razona» Demuestra que búsqueda guiada por redes gana al go. Cualquier extrapolación es interpretación.
«MCTS es una novedad del paper» MCTS es anterior. La novedad es guiarla y truncarla con redes aprendidas.
«Sirve para cualquier problema» Necesita simulador perfecto e información completa. Es una restricción muy fuerte.

12. Relación con trabajos anteriores

13. Relación con trabajos posteriores

14. Notebook asociado

P27_alphago.ipynb

Qué implementa: una posición de tres en raya resuelta con prior heurístico solo, y con búsqueda guiada por ese prior mediante despliegues aleatorios; más el reparto del presupuesto de simulaciones.

Qué NO implementa: nada del paper. No hay redes entrenadas, ni MCTS con UCT, ni autojuego. Tres en raya tiene 9 casillas; el go tiene más estados legales que átomos observables.

ai-evolution paper-lab P27 --seed 7

15. Actividades Bloom

Nivel Actividad
Recordar Di qué reduce la red de políticas y qué reduce la red de valor.
Explicar Explica el término u(s,a) y por qué decae con las visitas.
Aplicar Ejecuta el notebook y compara la jugada del prior con la de la búsqueda.
Analizar ¿Por qué el go resistió veinte años más que el ajedrez? Da las dos razones técnicas.
Evaluar ¿Qué problema real de tu entorno cumple los requisitos de este método? ¿Y cuál no?
Crear Diseña una función de evaluación para conecta-4 y compárala con despliegues aleatorios.

16. Autoevaluación

  1. ¿Qué dos dimensiones del árbol de búsqueda ataca cada red?
  2. ¿Por qué no bastaba MCTS con despliegues aleatorios?
  3. ¿Qué hace el prior cuando N(s,a) es 0 y qué cuando es grande?
  4. ¿Qué requisito del entorno hace inaplicable este método a la mayoría de problemas reales?
  5. ¿Qué diferencia hay entre esta versión y AlphaGo Zero?
  6. ¿Por qué el nivel de juego depende del presupuesto de simulaciones?
  7. ¿Qué idea de este paper reaparece en el razonamiento de modelos de lenguaje?

17. Respuestas esperadas

  1. La red de políticas reduce la anchura proponiendo pocas jugadas plausibles; la de valor reduce la profundidad evaluando sin llegar al final de la partida.
  2. Porque el factor de ramificación del go hace que los despliegues aleatorios sean demasiado poco informativos: se desperdicia el presupuesto en jugadas absurdas.
  3. Con N = 0 domina el prior, que es la única información disponible. Con N grande el término u decae y manda Q, la evidencia acumulada por las simulaciones.
  4. Necesita un simulador perfecto con reglas conocidas e información completa, y la posibilidad de simular millones de partidas.
  5. AlphaGo Zero prescinde de partidas humanas: aprende solo por autojuego desde cero.
  6. Porque la decisión sale de un recuento de simulaciones: más simulaciones, mejor estimación de Q y por tanto mejor elección.
  7. Que gastar cómputo al decidir —buscar, deliberar, verificar— puede rendir más que un modelo más grande que responde de una vez.

18. Fuentes primarias


⬅️ Anterior: P26 DQN · 📇 Índice · 📝 Evaluación · 🏫 Clase 017 · Juegos, minimax y poda alfa-beta · ➡️ Siguiente: P28 Chain-of-Thought