Saltar al contenido

🤖 Ingeniero de IA aplicada y recuperación

Construyes la parte del sistema que decide qué texto ve el modelo antes de que responda. Si esa parte falla, el modelo inventa con seguridad y elocuencia, y la culpa parecerá suya cuando en realidad fue de tu recuperación.

Nivel de entrada: avanzado (requiere SQL, modelado e índices) · Foco: embeddings, índices aproximados, búsqueda híbrida y evaluación de la recuperación · Cargos habituales: ingeniero de IA aplicada, ingeniero de búsqueda y recuperación, ML engineer de producto.

🎚️ nivel 🗂️ partes ⏱️ horas

🧭 Qué es y por qué importa

La mayoría de los sistemas de IA que llegan a producción no entrenan modelos: los usan, y gastan su esfuerzo en decidir con qué contexto los alimentan. Ese trabajo —fragmentar, indexar, buscar, filtrar por permisos, ordenar y medir— es ingeniería de datos y de recuperación, no aprendizaje automático. De ahí que este rol viva en un programa de bases de datos.

Importa porque la calidad de la respuesta está acotada por la calidad de la recuperación. Si el fragmento correcto no está entre los que recuperaste, ningún modelo lo va a adivinar; y si recuperaste basura plausible, la generará con la misma confianza. Medir la recuperación —recall@k y compañía— antes de tocar el prompt es lo que separa un sistema evaluable de una demostración con suerte.

Es un rol joven y con mucho ruido comercial. Cada semana aparece una base vectorial nueva y un patrón con nombre propio. Lo que no cambia: un índice aproximado intercambia exactitud por velocidad, un filtro por permisos aplicado después del ranking es una fuga de datos, y sin un conjunto de evaluación no puedes decir si tu cambio mejoró algo.

Lo que este programa no cubre: entrenar o afinar modelos, ni la ingeniería de prompts. Sí cubre lo que se rompe primero en producción.

🗓️ Un día en el puesto

🧠 Qué necesitas saber

Conocimiento técnico

Herramientas del oficio

Habilidades no técnicas

📚 Tu ruta en el programa

flowchart LR
    P00["🪜 00"]
    P01["🧱 01"]
    P02["📐 02"]
    P03["🔗 03"]
    P04["🔎 04"]
    P06["📄 06"]
    P07["🕸️ 07"]
    P09["🗂️ 09"]
    P13["🧠 13"]
    P14["🏛️ 14"]
    P00 --> P01 --> P02 --> P03 --> P04 --> P06 --> P07 --> P09 --> P13 --> P14
    classDef ini fill:#0b3d2e,stroke:#3fb950,color:#fff
    classDef fin fill:#3d2e0b,stroke:#e8590c,color:#fff
    class P00 ini
    class P14 fin

10 partes, 151 horas estimadas.

  1. 📚 Parte 00 — Primeros pasos: del archivo a la base de datos (10 clases · 20 h). La rampa de entrada. No la saltes por venir del lado del modelo: 010 — El mapa de los motores sitúa dónde encaja un índice vectorial entre las demás familias.
  2. 📚 Parte 01 — Fundamentos (4 clases · 12 h).
  3. 📚 Parte 02 — Modelado conceptual (5 clases · 16 h).
  4. 📚 Parte 03 — Modelo relacional y álgebra (4 clases · 13 h).
  5. 📚 Parte 04 — SQL en profundidad (6 clases · 20 h). Los filtros y las reuniones que acompañan a cada búsqueda.
  6. 📚 Parte 06 — Documentos y clave-valor (4 clases · 13 h). El agregado, la caché y su expiración.
  7. 📚 Parte 07 — Grafos, columnas, tiempo y búsqueda (5 clases · 15 h). Especialmente 041 — Búsqueda de texto: índice invertido y relevancia.
  8. 📚 Parte 09 — Almacenamiento, índices y planes (5 clases · 17 h). Con 051 — Índices especializados.
  9. 📚 Parte 13 — Vectores, recuperación y RAG (4 clases · 13 h). El núcleo: 068 — Embeddings y métricas de distancia, 069 — Índices vectoriales aproximados, 070 — Búsqueda híbrida y filtrado y 071 — RAG evaluable.
  10. 📚 Parte 14 — Arquitectura y proyecto final (3 clases · 12 h).

Laboratorios de la ruta:

🧪 Qué tienes que poder demostrar

🎓 Credenciales

No hay credencial reconocida para este rol —es demasiado nuevo— y desconfía de las que aparezcan atadas a un producto vectorial concreto. Lo que se valora es un proyecto donde se vea el conjunto de evaluación, las métricas antes y después de cada cambio y el tratamiento de permisos y borrado.

Si necesitas una credencial de contexto por la nube que uses, la Professional Data Engineer de Google Cloud cubre el lado de ingesta y almacenamiento; no evalúa recuperación.

📈 Progresión y mercado

  1. Desarrollador backend o ingeniero de datos con curiosidad por la recuperación.
  2. Ingeniero de IA aplicada — construyes recuperación y evaluación para un producto.
  3. Especialista en búsqueda y relevancia — el perfil clásico de search engineer, hoy con señal semántica añadida.
  4. Bifurcación: arquitectura de sistemas de datos, o aprendizaje automático propiamente dicho si te atrae entrenar y no recuperar.

Sobre cifras: no hay una fuente oficial equivalente al Occupational Outlook Handbook para este puesto —es demasiado reciente para tener epígrafe propio—, así que este repositorio no publica rangos. Desconfía de las cifras que circulan en redes sobre sueldos de «ingeniero de IA»: casi ninguna declara muestra ni método.

⚠️ Mitos y errores comunes

🚀 Siguientes pasos

  1. No empieces por la Parte 13: haz antes 00 → 03 y la 08. Un almacén vectorial mal indexado se diagnostica con las mismas herramientas que cualquier otro.
  2. Ejecuta 06-vector-search y añade dos documentos propios; observa cómo cambia el recall.
  3. Monta un conjunto de evaluación de 30 preguntas sobre tu propio corpus. Es tedioso y es lo que más valor te va a dar.
  4. Implementa la búsqueda híbrida y compara métricas contra la puramente vectorial.
  5. Diseña el borrado y la reindexación antes de que sean urgentes.
  6. Cierra con el proyecto final, midiendo la recuperación y no la elocuencia.

📖 De dónde sale esto

Fichas completas en el registro de fuentes.