Multi-Cloud Engineering
Descargar 📕 Manual de esta parte (PDF) 📚 Manual integral

Parte 10 — Observabilidad, SRE y confiabilidad

← Parte 09 · Índice completo · Parte 11 →

📥 Descargar: Esta parte en PDF · Manual integral

Nivel: avanzado · Clases: 12 · Duración sugerida: 6–8 semanas

Operar sistemas mediante señales, objetivos y aprendizaje de incidentes.

Resultados de la parte

Al completar esta parte podrás explicar el dominio con lenguaje independiente del proveedor, implementar sus mecanismos esenciales, diagnosticar fallos y defender decisiones mediante evidencia, costo, seguridad y objetivos de confiabilidad.

Modelo mental

La confiabilidad es una característica del servicio percibido por usuarios; SRE la administra con objetivos explícitos y presupuestos de error.

Secuencia

Diagrama del contenido de la clase

Clases

ID Clase Laboratorio Horas
121 Logs, métricas, trazas y eventos como señales observability 4
122 Logging estructurado, correlación y retención observability 4
123 Métricas, cardinalidad y modelos RED y USE metrics 4
124 Tracing distribuido y OpenTelemetry observability 4
125 Dashboards, alertas accionables y fatiga observability 4
126 SLI, SLO, SLA y presupuesto de error sre 4
127 Incidentes, severidad, comando y comunicación incident 4
128 Runbooks, playbooks y automatización operativa operations 4
129 Capacidad, rendimiento y pruebas de carga performance 4
130 Timeouts, retries, backoff, circuit breaker y bulkhead reliability 4
131 Chaos engineering y game days chaos 4
132 Proyecto: operación SRE de CloudShop capstone 8

Evaluación de la parte

Se aprueba con 80 % de clases en nivel B o superior y el proyecto integrador reproducible.

Pauta bibliográfica

Recorrido

Clases de la parte