Inicio · Parte 16 — Matemática de Transformers, modelos generativos, grafos y RL
embedding + positional encoding → self-attention causal → salida
tarea: predecir el token anterior
verificación: la atención debe concentrarse en la posición i−1
El capstone construye un Transformer causal completo con todos los componentes de la parte: embedding aprendido, codificación posicional sinusoidal, self-attention con máscara causal y proyección de salida. Son 101 parámetros y funciona.
La tarea elegida —predecir el token anterior— es deliberadamente trivial, y esa trivialidad es lo valioso. Permite verificar el mecanismo de forma directa: si la atención funciona como se ha descrito, la matriz de atención aprendida debe concentrar su masa en la posición i−1. No hace falta confiar en una métrica agregada; se puede mirar la matriz.
El papel de la codificación posicional se vuelve evidente aquí. Sin ella el modelo no podría resolver la tarea en absoluto, porque «el token anterior» es una noción puramente posicional y la atención por sí sola es ciega al orden. Quitarla y ver el fallo es el experimento de ablación más instructivo posible.
La distancia con un modelo real es de escala, no de concepto: los mismos componentes, repetidos decenas de veces y con dimensiones mil veces mayores. Entender qué hace cada pieza en 101 parámetros es lo que permite razonar sobre qué ocurre en 100 000 millones, y cierra el recorrido que empezó contando con los dedos en la parte 00.
Configuración del mini-Transformer.
tarea: predecir el token anterior (copia desplazada)
vocabulario: 6
d_model: 8
longitud de secuencia: 5
componentes:
embedding aprendido
positional encoding sinusoidal
self-attention causal
proyección de salida
parámetros entrenados: 101
Verificación esperada:
la matriz de atención debe concentrarse
en la posición i−1 para cada token i
Ablación: sin positional encoding la tarea
es irresoluble, porque "anterior" es posicional.
Capstone: mini-Transformer que aprende a copiar el token anterior.
python classes/part-16-matematica-de-transformers-modelos-generativos-grafos-y-rl/340-capstone-mini-transformer-matematico/lab.py
compmath run 340
tareavocabulariod_modellongitud_de_secuenciacomponentesparametros_entrenadosejemplos_trainejemplos_testhistorialaccuracy_trainaccuracy_testlinea_base_por_azarejemplo_entradaejemplo_objetivoejemplo_prediccionatencion_de_la_ultima_posicionsesgo_relativo_aprendidola_atencion_aprende_a_mirar_i-1dependencias_externassemilla{
"tarea": "predecir el token anterior (copia desplazada)",
"vocabulario": 6,
"d_model": 8,
"longitud_de_secuencia": 5,
"componentes": [
"embedding aprendido",
"positional encoding sinusoidal",
"self-attention causal de 1 cabeza con sesgo relativo aprendido",
"proyección a logits"
],
"parametros_entrenados": 101
}
Comprensión profunda de los Transformers, interpretabilidad mecanicista, docencia, entrevistas técnicas y depuración de implementaciones.
Esta parte es la traducción matemática directa de los papers que definen el estado del arte actual.
10.48550/arxiv.1706.03762 verificado en DataCite (2026-08-19).