Saltar al contenido

Parte 13 — Vectores, recuperación y RAG

La base de datos como componente de un sistema de inteligencia artificial: distancias, indices aproximados y recuperación medida.

4 clases · 13 horas · 19 conceptos · 9 fuentes

Antes de esta parte

Esta parte se apoya en lo trabajado antes. Si vienes de fuera del programa, revisa al menos el vocabulario de:

De qué trata esta parte

La base de datos como componente de un sistema de inteligencia artificial, tratada con el mismo rigor que el resto del programa: nada se da por bueno sin medirlo. Es la parte más nueva en fecha y la más expuesta a afirmaciones sin evidencia, así que es donde más se insiste en el conjunto de evaluación propio.

Primero qué significa parecido cuando lo decide un modelo: espacio vectorial, coseno, producto interno y normalización, con la advertencia que ordena toda la parte —el parecido es el que aprendió ese modelo concreto, así que cambiar de modelo cambia el significado de cerca—. Después los índices aproximados, HNSW e IVF, con la disciplina de medir el recall contra una búsqueda exhaustiva antes de dar por buena una configuración. Luego la búsqueda híbrida, porque lo léxico y lo vectorial se complementan: uno acierta con el término exacto y el otro con el significado. Y al final la evaluación de la recuperación, antes de mirar la generación.

La conexión con la parte 07 es directa: BM25 vuelve como componente léxico, y precisión y exhaustividad vuelven convertidas en recall@k y precisión@k.

Al terminar esta parte podrás

  1. Elegir la métrica de distancia adecuada y explicar el papel de la normalización.
  2. Configurar un índice aproximado y medir su recall contra una búsqueda exhaustiva.
  3. Combinar búsqueda léxica y vectorial con fusión de rangos y filtrado por metadatos.
  4. Evaluar la recuperación de un sistema RAG con recall@k, precisión@k y MRR sobre un conjunto propio.
  5. Justificar una estrategia de fragmentación con una medición y no con el valor por defecto.

Las clases, una por una

#ClaseNivelHorasFuentes
068Embeddings y métricas de distancia: qué significa parecidoIntermedio33
069Índices vectoriales aproximados: HNSW, IVF y el recallAvanzado44
070Búsqueda híbrida: léxica más vectorial y filtrado por metadatosAvanzado34
071RAG evaluable: medir la recuperación antes que la generaciónAvanzado33

068 — Embeddings y métricas de distancia: qué significa parecido

Intermedio · 3 h · 3 fuentes · requiere 041

Qué significa «parecido» cuando lo decide un modelo. Presenta el espacio vectorial, las métricas de coseno y producto interno, y la normalización que las vuelve equivalentes. La advertencia que ordena toda la parte: el parecido es el que aprendió ese modelo concreto, así que cambiar de modelo cambia el significado de cerca.

espacio vectorial coseno producto interno normalización dimensión

069 — Índices vectoriales aproximados: HNSW, IVF y el recall

Avanzado · 4 h · 4 fuentes · requiere 068, 049

Los índices que hacen viable la búsqueda vectorial renunciando a la exactitud. HNSW e IVF con sus parámetros, la cuantización que cambia memoria por precisión, y la disciplina que la clase impone: medir el recall contra una búsqueda exhaustiva antes de dar por buena una configuración, porque sin ese número «funciona» solo significa «devolvió algo».

búsqueda aproximada recall HNSW cuantización latencia frente a exactitud

070 — Búsqueda híbrida: léxica más vectorial y filtrado por metadatos

Avanzado · 3 h · 4 fuentes · requiere 041, 069

Por qué lo léxico y lo vectorial se combinan en lugar de competir: uno acierta con el término exacto, el otro con el significado. La fusión recíproca de rangos los une sin exigir que sus puntuaciones sean comparables, y el filtrado por metadatos plantea la decisión entre filtro previo y posterior, cada uno con su fallo característico.

BM25 fusión de rangos filtro previo filtro posterior

071 — RAG evaluable: medir la recuperación antes que la generación

Avanzado · 3 h · 3 fuentes · requiere 070

Medir la recuperación antes de mirar la generación, porque si el fragmento correcto no entra en el contexto ningún modelo de lenguaje podrá responder bien. Recall@k, precisión@k y MRR sobre un conjunto de evaluación propio, con la fragmentación como la decisión que más mueve la calidad y la que más se toma por defecto sin medirla.

recall@k precisión@k MRR fragmentación trazabilidad de la cita

Errores frecuentes en esta parte

Cada uno de estos es una creencia habitual y su corrección.

Vocabulario de la parte

Los 19 términos que esta parte introduce. Todos están también en el glosario del programa con sus términos relacionados.

TérminoQué significaSe trabaja en
BM25Función de relevancia que refina TF-IDF con saturación de la frecuencia y normalización por longitud del documento, gobernadas por los parámetros `k1` y `b`. Es la referencia léxica contra la que se compara cualquier buscador, incluidos los vectoriales.070
búsqueda aproximadaRenunciar a encontrar con certeza los K vecinos más cercanos a cambio de responder en milisegundos en lugar de en minutos. La búsqueda exacta compara contra todos los vectores; la aproximada explora solo una parte del espacio y acepta perderse algunos.069
cosenoMedida de similitud basada en el ángulo entre dos vectores, que ignora su magnitud. Es la métrica habitual con embeddings de texto, donde importa la dirección del significado y no la longitud del documento.068
cuantizaciónComprimir los vectores usando menos bits por componente —escalar, binaria o por producto—. Reduce la memoria en un orden de magnitud a cambio de precisión, y suele combinarse con un reordenamiento final sobre los vectores completos.069
dimensiónTabla que describe el contexto por el que se filtra y se agrupa: producto, cliente, tiempo, sucursal. Se desnormaliza a propósito para evitar reuniones en cada consulta, y es donde vive casi todo el significado del modelo. (En la parte 13 la misma palabra designa otra cosa: el número de componentes de un vector.)068
espacio vectorialRepresentación de un texto, una imagen o un usuario como un punto de N coordenadas, colocado por un modelo de forma que la cercanía refleje parecido semántico. El parecido es el que aprendió ese modelo concreto: cambiar de modelo cambia el significado de «cerca».068
filtro posteriorBuscar primero y filtrar después. Es simple y tiene un fallo característico: si de los K vecinos ninguno cumple el filtro, la respuesta llega vacía aunque existieran resultados válidos algo más lejos.070
filtro previoAplicar el filtro de metadatos antes de la búsqueda vectorial, de modo que solo se exploren los candidatos admisibles. Conserva el número de resultados pedido, pero puede degradar la navegación del grafo si el filtro es muy selectivo.070
fragmentaciónCómo se parte el documento antes de vectorizarlo: por tamaño, por párrafo, por sección, con o sin solape. Es la decisión que más mueve la calidad de un RAG y la que más se toma por defecto sin medirla.071
fusión de rangosCombinar dos listas ordenadas —la léxica y la vectorial— en una sola. La fusión recíproca de rangos suma el inverso de la posición en cada lista, y funciona bien precisamente porque no exige que las puntuaciones de ambos sistemas sean comparables entre sí.070
HNSWGrafo navegable de mundo pequeño por capas: las capas altas dan saltos largos y las bajas afinan. Da el mejor compromiso entre recall y latencia de los índices actuales, a costa de un uso de memoria alto y una construcción lenta.069
latencia frente a exactitudEl compromiso que gobiernan los parámetros del índice (`ef_search`, `nprobe`): explorar más nodos sube el recall y el tiempo de respuesta. No hay valor correcto universal; se elige midiendo con los datos y las consultas reales.069
MRRRango recíproco medio: la media de 1 dividido por la posición del primer resultado relevante. Premia colocar arriba la respuesta correcta, que es justo lo que importa cuando solo se van a leer los tres primeros fragmentos.071
normalizaciónEscalar cada vector a longitud 1. Hace equivalentes coseno y producto interno y permite usar el índice más rápido sin cambiar el orden de los resultados; es un paso rutinario que conviene declarar, porque mezclar vectores normalizados y sin normalizar arruina la búsqueda.068
precisión@kQué proporción de los K devueltos era relevante. Importa porque el contexto es finito y caro: llenar la ventana de ruido desplaza a los fragmentos que sí servían.071
producto internoMétrica que sí tiene en cuenta la magnitud, útil cuando el modelo codifica intensidad en la norma del vector. Sobre vectores normalizados es equivalente al coseno, y de ahí que normalizar simplifique la elección.068
recallQué proporción de los verdaderos K vecinos devolvió el índice aproximado. Es la métrica que hay que medir contra una búsqueda exhaustiva antes de dar por buena una configuración; sin ese número, «funciona» significa «devolvió algo».069
recall@kQué proporción de los documentos relevantes aparece entre los K primeros resultados. Es la métrica que gobierna un sistema RAG: si el fragmento correcto no entra en el contexto, ningún modelo de lenguaje podrá responder bien.071
trazabilidad de la citaQue cada afirmación de la respuesta pueda seguirse hasta el fragmento y el documento del que salió. Es lo que permite auditar el sistema y detectar la alucinación; sin ella no hay forma de distinguir una respuesta correcta de una convincente.071

Fuentes usadas en esta parte

9 obras distintas sostienen lo que se afirma en estas 4 clases.

Otras partes