Saltar al contenido

🛠️ Ingeniero de datos

Construyes las tuberías por las que circula el dato de la empresa: lo mueves entre sistemas, lo transformas y lo dejas disponible para que otros decidan. Cuando tu trabajo falla, nadie ve un error 500: ven un informe que dice algo distinto al del mes pasado.

Nivel de entrada: intermedio (requiere SQL y modelado sólidos) · Foco: integración, captura de cambios, modelado analítico y streaming · Cargos habituales: ingeniero de datos, ingeniero de plataforma de datos, ingeniero de streaming.

🎚️ nivel 🗂️ partes ⏱️ horas

🧭 Qué es y por qué importa

La ingeniería de datos existe porque el dato nace en un sitio y se necesita en otro. Nace en una base transaccional optimizada para escribir pedidos de uno en uno, y se necesita en un almacén optimizado para responder «cuánto vendimos por región y mes» sobre millones de filas. Entre esos dos mundos hay un trabajo de ingeniería: extraer sin frenar el origen, transformar sin perder el significado, cargar sin duplicar y dejar constancia de qué pasó.

Importa porque el error de datos es silencioso. Un servicio caído se nota en un minuto; una tubería que duplica el 3 % de las filas puede tardar meses en descubrirse, y para entonces hay decisiones tomadas sobre esos números. Por eso el oficio se juzga por trazabilidad e idempotencia más que por elegancia: poder decir de dónde salió cada fila y poder reprocesar sin ensuciar.

También es un rol con mucha moda encima. Cada año aparece una herramienta que promete resolver la integración; lo que no cambia es el problema de fondo —semántica, tiempo, orden y duplicados— que ya describían el modelado dimensional en los noventa y los sistemas de streaming modernos. Este programa se apoya en ese fondo, no en el catálogo de herramientas del trimestre.

Lo que aquí no vas a aprender: operar un clúster concreto de un proveedor en producción, ni negociar con el equipo de negocio qué significa «cliente activo» —que suele ser la parte más difícil del trabajo real—.

🗓️ Un día en el puesto

🧠 Qué necesitas saber

Conocimiento técnico

Herramientas del oficio

Habilidades no técnicas

📚 Tu ruta en el programa

flowchart LR
    P00["🪜 00"]
    P01["🧱 01"]
    P02["📐 02"]
    P03["🔗 03"]
    P04["🔎 04"]
    P07["🕸️ 07"]
    P10["🌐 10"]
    P12["📊 12"]
    P13["🧠 13"]
    P14["🏛️ 14"]
    P00 --> P01 --> P02 --> P03 --> P04 --> P07 --> P10 --> P12 --> P13 --> P14
    classDef ini fill:#0b3d2e,stroke:#3fb950,color:#fff
    classDef fin fill:#3d2e0b,stroke:#e8590c,color:#fff
    class P00 ini
    class P14 fin

10 partes, 151 horas estimadas.

  1. 📚 Parte 00 — Primeros pasos: del archivo a la base de datos (10 clases · 20 h). La rampa de entrada. Para este rol la clase que más rinde es 010 — El mapa de los motores: el criterio con el que después se eligen destino y formato.
  2. 📚 Parte 01 — Fundamentos (4 clases · 12 h).
  3. 📚 Parte 02 — Modelado conceptual (5 clases · 16 h). El significado antes que el formato.
  4. 📚 Parte 03 — Modelo relacional y álgebra (4 clases · 13 h).
  5. 📚 Parte 04 — SQL en profundidad (6 clases · 20 h). Tu herramienta diaria; no la aprendas a medias.
  6. 📚 Parte 07 — Grafos, columnas, tiempo y búsqueda (5 clases · 15 h). Especialmente 040 — Series temporales y 042 — Analítica columnar y vectorización.
  7. 📚 Parte 10 — Distribución, réplica y consistencia (5 clases · 17 h). Sin esto, «eventualmente consistente» es una excusa y no un modelo.
  8. 📚 Parte 12 — Analítica, integración y streaming (4 clases · 13 h). El corazón del rol: 064 — OLTP frente a OLAP, 065 — Modelado dimensional, 066 — ETL, ELT y captura de cambios y 067 — Streaming, tiempo de evento y ventanas.
  9. 📚 Parte 13 — Vectores, recuperación y RAG (4 clases · 13 h). Cada vez más tuberías terminan alimentando una búsqueda semántica.
  10. 📚 Parte 14 — Arquitectura y proyecto final (3 clases · 12 h).

Laboratorios de la ruta:

🧪 Qué tienes que poder demostrar

🎓 Credenciales

La credencial más reconocible del rol es la Professional Data Engineer de Google Cloud: examen de dos horas, 40–50 preguntas, válido dos años, sin prerrequisitos, y con una experiencia recomendada de tres años en la industria. Cubre diseño de sistemas de procesamiento, ingesta, almacenamiento, preparación para análisis y automatización de cargas.

Dos advertencias honestas: está atada a un proveedor —te enseña su catálogo tanto como el oficio— y caduca. Lo que no caduca es entender el modelado y la semántica del tiempo, que es justo lo que trabajan las Partes 11 y 09 de este programa.

📈 Progresión y mercado

  1. Analista de datos o desarrollador con SQL fuerte: la entrada más común.
  2. Ingeniero de datos — construyes y mantienes tuberías con supervisión.
  3. Ingeniero de datos sénior — diseñas el modelo analítico y los contratos con los orígenes.
  4. Bifurcación: plataforma de datos y fiabilidad (cerca de DBA / SRE), analytics engineering si te atrae la capa de negocio, o arquitectura si te atrae decidir el conjunto.

Referencia de mercado con fuente: el Occupational Outlook Handbook del U.S. Bureau of Labor Statistics publica sueldos medianos y proyección de empleo para los puestos de administración y arquitectura de bases de datos en Estados Unidos —el epígrafe más cercano a este rol en una fuente oficial—. Para tu país, contrasta ofertas reales: aquí no inventamos rangos locales.

⚠️ Mitos y errores comunes

🚀 Siguientes pasos

  1. Asegura las Partes 00 → 03: sin SQL y modelado sólidos, el resto se construye sobre arena.
  2. Haz la Parte 12 completa y modela un dominio propio en estrella, declarando el grano.
  3. Ejecuta 05-nosql-workloads y aplica la lección de la clave caliente a tu partición real.
  4. Toma una tubería tuya y hazla idempotente; demuestra con conteos que reprocesar no duplica.
  5. Estudia la Parte 10 antes de prometer consistencia entre sistemas.
  6. Cierra con el proyecto final, midiendo lo que afirmas.

📖 De dónde sale esto

Fichas completas en el registro de fuentes.