Fuentes
Cada afirmación del programa se apoya en una entrada de este registro. Una clase sin fuentes no se publica: scripts/validate_repository.py lo bloquea. Los enlaces se revisan con scripts/check_external_links.py antes de cada actualización.
Libros
Texto de referencia universitario. El sitio oficial publica diapositivas y capítulos de muestra.
Motor de almacenamiento (B-Tree y LSM) y consenso explicados con detalle de implementación.
Recetas comparadas entre dialectos, útil para la matriz de portabilidad.
Lectura libre. Objetivos de nivel de servicio y presupuesto de error.
Catálogo de errores de modelado con su corrección y cuando el antipatron es aceptable.
Separa el modelo relacional de lo que SQL realmente implementa, incluidos los nulos.
PDF gratuito. MVCC, vacuum, buffers, índices y planificador sobre el código real.
Tratamiento formal de dependencias funcionales, normalización y optimización.
Descarga gratuita. Modelado de grafos de propiedades y recorridos.
Modelado dirigido por consultas en un motor de columnas anchas.
Obra canónica sobre ACID, bloqueo, registro y recuperación.
Modelado de jerarquias, conjuntos anidados y SQL declarativo avanzado.
Ciclo de vida de la ingenieria de datos e integración entre sistemas.
Operación, respaldos, objetivos de servicio y gestion de cambios.
Versión web gratuita. Índices B-Tree y su relación con el orden de las columnas.
Referencia central del programa para replicación, partición, transacciones distribuidas y streaming.
Método de diseño paso a paso, independiente de producto.
Antologia comentada de acceso libre. Cada capitulo situa los papers en su discusión.
Enfoque de sistemas: monitores transaccionales, colas y commit en dos fases.
Origen del término agregado y de la persistencia políglota que estructura este programa.
Fuerte en álgebra relacional, evaluación de consultas y estructuras de almacenamiento.
Modelado dimensional, tablas de hechos y dimensiones de cambio lento.
Migraciones con período de transición y compatibilidad hacia atras.
Modelado documental, índices y canalización de agregación.
Tiempo de evento, ventanas, marcas de agua y la dualidad tabla-flujo.
Por qué ningún modelo captura el mundo: fuente del criterio de alcance del programa.
Artículos e informes
Definición de los fenomenos de aislamiento independiente de la implementación.
Filtro de Bloom: clave para evitar lecturas de disco en motores LSM.
Algoritmo de recuperación con registro anticipado que implementan casi todos los motores.
PACELC: el compromiso latencia-consistencia existe también sin particiones.
Raft: consenso equivalente a Paxos con elección de líder explicita.
Artículo fundacional del modelo relacional y de la independencia de datos.
Introduce los valores nulos y la semántica de información faltante.
El propio autor corrige la lectura simplista de elegir dos de tres.
Origen del modelo de familias de columnas que adoptaron HBase y Cassandra.
Hash consistente, quorums ajustables y reconciliación en el cliente.
Estado del arte del B-Tree: división, compresión y concurrencia.
Demuestra que los niveles de la norma no definen sin ambigüedad las anomalías e introduce snapshot isolation.
Serializabilidad global usando incertidumbre de reloj acotada (TrueTime).
El registro append-only como nexo entre replicación, integración y streaming. Se cita la copia archivada: LinkedIn retiro el original.
FAISS: cuantización de producto y compromiso memoria-exactitud.
Por qué la latencia se mide en percentiles altos y no en promedio.
Define la transacción como unidad de consistencia y recuperación.
Cuantifica cómo crecen los conflictos con el número de réplicas.
Descripción completa de los componentes internos de un SGBD relacional.
Orden causal y relojes logicos: base de la consistencia distribuida.
Paxos, el primer algoritmo de consenso práctico demostrado correcto.
Estructuras que convergen sin coordinación: alternativa al bloqueo distribuido.
Mide en qué gasta el tiempo realmente un motor OLTP tradicional.
Base del optimizador por costos que siguen usando los motores actuales.
Entidades, actividades y por qué las transacciones distribuidas no escalan.
Artículo que define RAG: la base de datos es parte del sistema, no un accesorio.
Estructura que sostiene RocksDB, Cassandra, ScyllaDB y LevelDB.
Qué garantías transaccionales sobreviven a una partición y cuáles no.
Origen del diagrama entidad-relación.
Conteo aproximado de distintos con memoria prácticamente constante.
Artículo original del B-Tree.
Demostración formal del teorema CAP y de su enunciado exacto.
Uso declarado de cada motor por decenas de miles de profesionales. Sirve para hablar de adopción real en vez de impresiones, con su sesgo de muestra declarado.
Función de ranking léxico contra la que se compara toda búsqueda semántica.
Recuperación densa entrenada, y su comparación honesta contra BM25.
Definición operativa de consistencia eventual y de sus variantes de sesión.
Índice HNSW: el que usan Qdrant, Weaviate, Milvus, pgvector y Lucene.
Normas y marcos
Marco chileno de datos personales aplicable a los proyectos del programa.
Guias de configuración endurecida para PostgreSQL, MySQL, MongoDB y otros.
Norma del lenguaje SQL. Ningún motor la implementa por completo.
Contrato de parametrización que evita la concatenación de entradas.
Controles de auditoria, cifrado y acceso aplicables a bases de datos.
Funciones Gobernar, Identificar, Proteger, Detectar, Responder y Recuperar.
A03 Inyección y A01 Control de acceso roto afectan directamente al diseño de datos.
Consultas parametrizadas como defensa principal, con sus excepciones.
Única fuente pública y periódica sobre el mercado del rol: sueldo mediano, proyección de empleo y formación de entrada en Estados Unidos. Las rutas la citan para no inventar cifras de carrera.
Minimización, limitación de finalidad y derecho de supresión con efecto en el esquema.
Documentación oficial
Credencial de ingenieria de datos de AWS: 65 preguntas, 130 minutos, vigencia de tres anos.
Guia oficial del examen con el peso de cada dominio: 34, 26, 22 y 18 por ciento del contenido evaluado.
Búsqueda vectorial dentro de PostgreSQL: evita un sistema adicional cuando no hace falta.
CQL, claves de partición y niveles de consistencia ajustables.
Particiones, orden, retención y semántica de entrega.
Formato de tabla con instantaneas y evolución de esquema sobre almacenamiento de objetos.
Motores de tabla, claves de ordenamiento y vistas materializadas.
Credencial de gestión de datos en tres niveles, basada en el cuerpo de conocimiento de DAMA. Referencia para la ruta de gobierno y privacidad del dato.
Captura de cambios leyendo el registro de transacciones del motor.
Perfiles y comprobaciones de salud usados por los laboratorios con contenedores.
Motor analítico embebido: OLAP columnar sin servidor.
Temario oficial de la credencial de ingeniería de datos en Google Cloud: diseño de sistemas de procesamiento, ingesta, almacenamiento y automatización.
Modelo de medición, etiquetas y campos para series temporales.
Mapa de modelos de consistencia y sus relaciones de implicación.
Informes que verifican empiricamente las garantías que cada motor afirma.
Índices vectoriales distribuidos y sus compromisos de exactitud.
Divergencias respecto de MySQL relevantes para la portabilidad.
Guion reproducible que muestra que anomalías permite cada motor en cada nivel.
T-SQL, niveles de aislamiento y almacen de consultas.
Temario oficial del examen DP-300: operación, seguridad, alta disponibilidad y recuperación sobre SQL Server y Azure SQL. Referencia de credencial para la ruta de operación.
Temario con los pesos oficiales por dominio del examen DP-300. De aqui salen las ponderaciones del mapeo de certificaciones.
Credencial de entrada al trabajo con datos: conceptos, cargas transaccionales y analiticas.
Temario con los pesos oficiales por dominio del examen DP-900.
Modelo documental, índices, agregación y transacciones multi-documento.
Criterio para incrustar o referenciar según patrones de acceso.
Cypher y modelo de grafo de propiedades.
Índice invertido, analizadores, relevancia y búsqueda k-NN.
Dialecto y comportamiento del motor InnoDB.
PL/SQL y modelo de consistencia de lectura de Oracle.
Documentación de referencia del motor relacional principal del programa.
Niveles de aislamiento tal como los implementa PostgreSQL, no como los define la norma.
Lectura de planes de ejecución y diferencia entre costo estimado y tiempo real.
B-tree, hash, GiST, SP-GiST, GIN y BRIN con sus casos de uso.
Volcado lógico, copia de archivos y recuperación a un punto en el tiempo.
Control de acceso por fila declarado en el propio motor.
API DB-API 2.0 usada por los laboratorios ejecutables del repositorio.
Colecciones, filtros con carga útil y parametros HNSW.
Estructuras de datos, expiración y semántica de comandos.
RDB frente a AOF: qué se pierde exactamente en cada configuración.
Motor embebido usado por los laboratorios sin dependencias del programa.
Que garantiza y que no garantiza SQLite entre conexiones.
Registro anticipado explicado en un motor lo bastante pequeno para leerlo entero.
Como decide SQLite usar un índice; útil para leer EXPLAIN QUERY PLAN.
Hipertablas, compresión y agregados continuos sobre PostgreSQL.
Transformaciones versionadas y pruebas de datos en el almacen.
Ranking mensual de más de 400 gestores por menciones, ofertas de empleo y perfiles profesionales. Mide visibilidad y demanda laboral, no calidad técnica.