Parte 10 — Observabilidad, SRE y confiabilidad
📥 Descargar: Esta parte en PDF · Manual integral
Nivel: avanzado · Clases: 12 · Duración sugerida: 6–8 semanas
Operar sistemas mediante señales, objetivos y aprendizaje de incidentes.
Resultados de la parte
Al completar esta parte podrás explicar el dominio con lenguaje independiente del proveedor, implementar sus mecanismos esenciales, diagnosticar fallos y defender decisiones mediante evidencia, costo, seguridad y objetivos de confiabilidad.
Modelo mental
La confiabilidad es una característica del servicio percibido por usuarios; SRE la administra con objetivos explícitos y presupuestos de error.
Secuencia
Clases
| ID | Clase | Laboratorio | Horas |
|---|---|---|---|
| 121 | Logs, métricas, trazas y eventos como señales | observability |
4 |
| 122 | Logging estructurado, correlación y retención | observability |
4 |
| 123 | Métricas, cardinalidad y modelos RED y USE | metrics |
4 |
| 124 | Tracing distribuido y OpenTelemetry | observability |
4 |
| 125 | Dashboards, alertas accionables y fatiga | observability |
4 |
| 126 | SLI, SLO, SLA y presupuesto de error | sre |
4 |
| 127 | Incidentes, severidad, comando y comunicación | incident |
4 |
| 128 | Runbooks, playbooks y automatización operativa | operations |
4 |
| 129 | Capacidad, rendimiento y pruebas de carga | performance |
4 |
| 130 | Timeouts, retries, backoff, circuit breaker y bulkhead | reliability |
4 |
| 131 | Chaos engineering y game days | chaos |
4 |
| 132 | Proyecto: operación SRE de CloudShop | capstone |
8 |
Evaluación de la parte
- 35 % laboratorios y evidencia reproducible.
- 25 % retos verificables.
- 20 % decisiones y ADR.
- 10 % seguridad, confiabilidad y costo.
- 10 % proyecto integrador de la parte.
Se aprueba con 80 % de clases en nivel B o superior y el proyecto integrador reproducible.
Pauta bibliográfica
- Site Reliability Engineering — Beyer et al..
- The Site Reliability Workbook — Beyer et al..
- Observability Engineering — Majors, Fong-Jones y Miranda.
Recorrido
Clases de la parte
Logs, métricas, trazas y eventos como señalesobservability · 4 h
Logging estructurado, correlación y retenciónobservability · 4 h
Métricas, cardinalidad y modelos RED y USEmetrics · 4 h
Tracing distribuido y OpenTelemetryobservability · 4 h
Dashboards, alertas accionables y fatigaobservability · 4 h
SLI, SLO, SLA y presupuesto de errorsre · 4 h
Incidentes, severidad, comando y comunicaciónincident · 4 h
Runbooks, playbooks y automatización operativaoperations · 4 h
Capacidad, rendimiento y pruebas de cargaperformance · 4 h
Timeouts, retries, backoff, circuit breaker y bulkheadreliability · 4 h
Chaos engineering y game dayschaos · 4 h
Proyecto: operación SRE de CloudShopcapstone · 8 h