🧮 Computational Mathematics

Inicio · Parte 16 — Matemática de Transformers, modelos generativos, grafos y RL

340 — Capstone: mini-Transformer matemático

experto clase 20 de 20 4 horas demostración capstone_mini_transformer

Un Transformer de 101 parámetros aprende a mirar exactamente una posición atrás.

Fórmulas

embedding + positional encoding → self-attention causal → salida
tarea: predecir el token anterior
verificación: la atención debe concentrarse en la posición i−1

Desarrollo

El capstone construye un Transformer causal completo con todos los componentes de la parte: embedding aprendido, codificación posicional sinusoidal, self-attention con máscara causal y proyección de salida. Son 101 parámetros y funciona.

La tarea elegida —predecir el token anterior— es deliberadamente trivial, y esa trivialidad es lo valioso. Permite verificar el mecanismo de forma directa: si la atención funciona como se ha descrito, la matriz de atención aprendida debe concentrar su masa en la posición i−1. No hace falta confiar en una métrica agregada; se puede mirar la matriz.

El papel de la codificación posicional se vuelve evidente aquí. Sin ella el modelo no podría resolver la tarea en absoluto, porque «el token anterior» es una noción puramente posicional y la atención por sí sola es ciega al orden. Quitarla y ver el fallo es el experimento de ablación más instructivo posible.

La distancia con un modelo real es de escala, no de concepto: los mismos componentes, repetidos decenas de veces y con dimensiones mil veces mayores. Entender qué hace cada pieza en 101 parámetros es lo que permite razonar sobre qué ocurre en 100 000 millones, y cierra el recorrido que empezó contando con los dedos en la parte 00.

Ejemplo trabajado

Configuración del mini-Transformer.

tarea: predecir el token anterior (copia desplazada)

vocabulario: 6
d_model: 8
longitud de secuencia: 5

componentes:
  embedding aprendido
  positional encoding sinusoidal
  self-attention causal
  proyección de salida

parámetros entrenados: 101

Verificación esperada:
  la matriz de atención debe concentrarse
  en la posición i−1 para cada token i

Ablación: sin positional encoding la tarea
es irresoluble, porque "anterior" es posicional.

Qué calcula el laboratorio

Capstone: mini-Transformer que aprende a copiar el token anterior.

python classes/part-16-matematica-de-transformers-modelos-generativos-grafos-y-rl/340-capstone-mini-transformer-matematico/lab.py
compmath run 340

Salidas del laboratorio (20)

Muestra de la ejecución real

{
  "tarea": "predecir el token anterior (copia desplazada)",
  "vocabulario": 6,
  "d_model": 8,
  "longitud_de_secuencia": 5,
  "componentes": [
    "embedding aprendido",
    "positional encoding sinusoidal",
    "self-attention causal de 1 cabeza con sesgo relativo aprendido",
    "proyección a logits"
  ],
  "parametros_entrenados": 101
}

Errores comunes

Dónde se usa

Comprensión profunda de los Transformers, interpretabilidad mecanicista, docencia, entrevistas técnicas y depuración de implementaciones.

Idea rectora de la parte

Bellman expresa el valor como recompensa inmediata más valor futuro descontado.

Error a evitar

Confundir temperatura alta con mayor calidad en lugar de mayor entropía.

Conexión con IA

Esta parte es la traducción matemática directa de los papers que definen el estado del arte actual.

Bibliografía de la clase

Archivos de la clase