P11 — RAG

Separar lo que el sistema sabe de cómo razona: el conocimiento pasa a un índice consultable, actualizable y citable, en vez de quedar congelado en los pesos.

Nivel: L3 · Motor: rag · Notebook: P11_rag.ipynb · Anexo: álgebra y geometría

1. Identificación

Campo Valor
Título original Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks
Autoría Patrick Lewis, Ethan Perez, Aleksandra Piktus, Fabio Petroni y otros
Año 2020
Venue arXiv:2005.11401 · NeurIPS 2020
Fuente primaria arXiv:2005.11401
Acceso Abierto
Fecha de consulta 2026-08-16

2. Problema anterior

Todo lo que un modelo preentrenado sabe está en sus pesos. Eso tiene cuatro consecuencias incómodas:

  1. No se puede actualizar sin reentrenar o ajustar.
  2. No se puede auditar: no hay forma de saber de dónde salió una afirmación.
  3. No se puede corregir un dato erróneo de forma quirúrgica.
  4. El modelo alucina: cuando no sabe, genera algo plausible con la misma confianza.

Trabajos previos habían mostrado que los modelos de lenguaje almacenan cantidades sorprendentes de conocimiento factual (Petroni et al., 2019), y a la vez que ese conocimiento es opaco y difícil de mantener.

3. Propuesta

Combinar memoria paramétrica (los pesos del modelo generativo) con memoria no paramétrica (un índice denso sobre un corpus de documentos):

  1. Un recuperador denso (DPR) codifica la consulta y los documentos en el mismo espacio vectorial y devuelve los k pasajes más similares.
  2. Un generador seq2seq (BART) produce la respuesta condicionada a la consulta y a los pasajes recuperados.
  3. Ambos se entrenan de forma conjunta: la señal de la generación llega al codificador de la consulta (el índice de documentos se mantiene fijo, por coste).

El artículo propone dos variantes: RAG-Sequence, que usa el mismo documento para toda la respuesta, y RAG-Token, que puede cambiar de documento en cada token generado.

4. Intuición sin fórmulas

Un examen a libro cerrado frente a uno a libro abierto. A libro cerrado, si no lo recuerdas, lo inventas. A libro abierto, buscas la página, la citas y quien corrige puede verificarla.

Dónde deja de funcionar la analogía: en el examen a libro abierto, encontrar la página garantiza casi la respuesta. Aquí no: el generador puede recuperar el documento correcto y aun así contradecirlo. Recuperar y responder son dos fallos independientes.

5. Matemática mínima

Recuperación densa:
    sim(x, z) = q(x)ᵀ · d(z)          →  top-k(x) por producto escalar

RAG-Sequence (un documento para toda la salida):
    p(y | x) ≈ Σ_{z ∈ top-k(x)}  p_η(z | x) · Π_t p_θ(y_t | x, z, y_<t)

RAG-Token (documento distinto por token):
    p(y | x) ≈ Π_t  Σ_{z ∈ top-k(x)}  p_η(z | x) · p_θ(y_t | x, z, y_<t)

💡 Consejo

Puente matemático. Esta sección da por sabido lo siguiente. Si algo no te suena, léelo primero: está explicado una sola vez, en un solo sitio, y sirve para todas las fichas.

Dónde Qué necesitas de ahí
A01 §2 · Norma y coseno recuperar es ordenar por coseno: sin esa métrica no hay recuperación

6. Arquitectura o flujo

   consulta x
       │
       ▼
  ┌──────────────┐        ┌─────────────────────────┐
  │ codificador  │───────►│  índice denso (MIPS)    │
  │ de consulta  │        │  corpus vectorizado     │
  └──────────────┘        └────────────┬────────────┘
                                       │ top-k pasajes z
                                       ▼
                        ┌──────────────────────────┐
       x ──────────────►│  generador seq2seq       │──► respuesta y
                        │  condicionado a (x, z)   │    + cita [z]
                        └──────────────────────────┘

  Actualizar conocimiento = reindexar documentos.  Sin tocar los pesos.

7. Qué observar en el paper original

8. Evidencia y resultados

Evaluación en tareas intensivas en conocimiento: respuesta a preguntas de dominio abierto (Natural Questions, TriviaQA, WebQuestions, CuratedTrec), generación de preguntas de Jeopardy y verificación de hechos (FEVER).

RAG establece nuevos máximos en varias de las tareas de respuesta a preguntas de libro abierto del momento, y genera respuestas más específicas y factuales que los modelos puramente paramétricos comparables. En verificación de hechos alcanza resultados cercanos a sistemas con supervisión de evidencia mucho más rica.

Las cifras por tarea (Exact Match, precisión) están en las tablas del artículo. Verificarlas allí antes de citarlas.

La miniatura de este eje aporta el mecanismo y un fallo real: con recuperación léxica, la consulta correcta sitúa el documento pertinente en primer lugar (score 0,78); una consulta sin respuesta en el corpus también devuelve un documento, con score bajo. De ahí la necesidad de un umbral de abstención.

9. Impacto

10. Limitaciones

  1. Tres fallos independientes. (a) el documento no está en el índice; (b) está y no se recupera; (c) se recupera y el generador lo contradice. Evaluar RAG exige medir los tres por separado.
  2. Alucinación con cita. El caso más peligroso: la cita es real y relevante, pero la afirmación no está en ella. Difícil de detectar a simple vista.
  3. Calidad limitada por la del corpus. Un índice con documentos obsoletos o contradictorios produce respuestas obsoletas o contradictorias, con toda la apariencia de rigor.
  4. Coste de latencia añadido por la recuperación.
  5. El índice de documentos permanece fijo durante el entrenamiento conjunto del paper: no se reentrena el codificador de documentos.
  6. Fragmentación (chunking) y granularidad son decisiones de ingeniería con enorme impacto y ninguna respuesta universal.
  7. No sabe abstenerse. El paper no incorpora un mecanismo de «no lo sé»; hay que añadirlo.

11. Errores comunes

Error Corrección
«RAG elimina las alucinaciones» Las reduce y las hace auditables. Un modelo puede citar bien y afirmar mal.
«RAG es meter documentos en el prompt» En el paper, el documento es una variable latente marginalizada y el sistema se entrena conjuntamente. Meter texto en el prompt es un caso particular, mucho más simple.
«Si la respuesta lleva cita, es correcta» Hay que verificar que la afirmación esté en el documento citado.
«Recuperar bien basta» Recuperación y generación fallan de forma independiente; hay que medir ambas.
«RAG usa búsqueda por palabras clave» Usa recuperación densa (DPR). La léxica es una alternativa más simple, útil y a menudo complementaria.
«Con RAG el modelo ya no necesita saber nada» La memoria paramétrica sigue haciendo el trabajo de comprender la consulta y redactar la respuesta.

12. Relación con trabajos anteriores

13. Relación con trabajos posteriores

14. Notebook asociado

P11_rag.ipynb

Qué implementa: recuperación por similitud de coseno sobre frecuencias de términos, generación con citas explícitas, el contraste con la respuesta sin recuperación, un caso de alucinación con cita y un mecanismo de abstención por umbral.

Qué NO implementa: DPR, entrenamiento conjunto, marginalización sobre documentos ni BART. La recuperación es léxica, no densa: ilustra el patrón, no el método del paper.

ai-evolution paper-lab P11 --seed 7

15. Actividades Bloom

Nivel Actividad
Recordar Escribe la fórmula de RAG-Sequence e identifica qué representa z.
Explicar Explica la diferencia entre memoria paramétrica y no paramétrica con un ejemplo de mantenimiento.
Aplicar Ejecuta el notebook y ajusta el umbral de abstención hasta que la consulta sin respuesta se rechace.
Analizar Diseña tres consultas que provoquen cada uno de los tres modos de fallo.
Evaluar Te presentan un sistema con «95 % de respuestas con cita». ¿Qué métricas pides antes de aceptarlo?
Crear Diseña un protocolo de evaluación con tres métricas separadas (recuperación, fidelidad, abstención) y define cómo medir cada una.

16. Autoevaluación

  1. ¿Qué significa marginalizar sobre el documento latente y por qué no es lo mismo que elegir el mejor?
  2. ¿Cuál es la diferencia práctica entre RAG-Sequence y RAG-Token?
  3. Nombra los tres modos de fallo de un sistema RAG y una métrica para cada uno.
  4. ¿Por qué una alucinación con cita es más peligrosa que una sin cita?
  5. ¿Qué se necesita para actualizar el conocimiento de un sistema RAG?
  6. ¿Por qué hace falta un umbral de abstención y qué se rompe sin él?
  7. ¿Qué parte del sistema sigue dependiendo de la memoria paramétrica del modelo?

17. Respuestas esperadas

  1. Sumar sobre los k documentos ponderando por su probabilidad de recuperación, en vez de condicionar solo al mejor. Así la respuesta agrega evidencia de varios pasajes y es más robusta a un error del recuperador en la primera posición.
  2. RAG-Sequence usa el mismo documento para toda la respuesta (mejor cuando la respuesta viene de una fuente única); RAG-Token puede cambiar de documento en cada token (mejor cuando la respuesta combina hechos de varias fuentes).
  3. (a) cobertura del índice → recall del corpus; (b) recuperación → recall@k / MRR; (c) fidelidad → proporción de afirmaciones verificables en el contexto recuperado.
  4. Porque la cita aporta una señal de credibilidad que el lector usa como atajo. Verificarla exige leer la fuente, y la mayoría no lo hace.
  5. Reindexar los documentos. No hace falta tocar los pesos del modelo.
  6. Porque el recuperador siempre devuelve algo: sin umbral, una consulta fuera del dominio recibe el documento «menos malo» y el generador construirá una respuesta sobre él.
  7. Comprender la consulta, integrar los pasajes y redactar una respuesta coherente. RAG cambia de dónde vienen los hechos, no quién los redacta.

18. Fuentes primarias


⬅️ Anterior: P10 GPT-3 · 📇 Índice · 📝 Evaluación · 🏫 Clase 105 del programa · ➡️ Siguiente: P12 InstructGPT