Parte 21 — Operación cloud, automatización y respuesta a incidentes
📥 Descargar: Esta parte en PDF · Manual integral
Nivel: avanzado · Clases: 12 · Duración sugerida: 6–8 semanas
Convertir la operación diaria en procesos observables, repetibles y progresivamente automatizados.
Resultados de la parte
Al completar esta parte podrás explicar el dominio con lenguaje independiente del proveedor, implementar sus mecanismos esenciales, diagnosticar fallos y defender decisiones mediante evidencia, costo, seguridad y objetivos de confiabilidad.
Modelo mental
Operar es controlar cambios bajo incertidumbre: inventario, señal, diagnóstico, acción reversible y aprendizaje deben formar un ciclo cerrado.
Secuencia
Clases
| ID | Clase | Laboratorio | Horas |
|---|---|---|---|
| 253 | Inventario, etiquetado, CMDB y ownership | governance |
4 |
| 254 | Patching, imágenes doradas y gestión de configuración | operations |
4 |
| 255 | Backups, restore testing, vaults e inmutabilidad | reliability |
4 |
| 256 | Administración remota sin SSH permanente | security |
4 |
| 257 | Alertas, on-call, escalamiento y comunicación | incident |
4 |
| 258 | Triage de red, cómputo, datos y dependencias | incident |
4 |
| 259 | Runbooks ejecutables y auto-remediation | operations |
4 |
| 260 | Change management, ventanas y rollback | delivery |
4 |
| 261 | Game days, chaos engineering y aprendizaje | chaos |
4 |
| 262 | Capacity planning, cuotas y gestión de demanda | capacity |
4 |
| 263 | AIOps, automatización asistida y límites humanos | governance |
4 |
| 264 | Proyecto: centro de operaciones de CloudShop | capstone |
8 |
Evaluación de la parte
- 35 % laboratorios y evidencia reproducible.
- 25 % retos verificables.
- 20 % decisiones y ADR.
- 10 % seguridad, confiabilidad y costo.
- 10 % proyecto integrador de la parte.
Se aprueba con 80 % de clases en nivel B o superior y el proyecto integrador reproducible.
Pauta bibliográfica
- The Site Reliability Workbook — Beyer et al..
- Seeking SRE — Murphy et al..
- Effective DevOps — Davis y Daniels.
Recorrido
Clases de la parte
Inventario, etiquetado, CMDB y ownershipgovernance · 4 h
Patching, imágenes doradas y gestión de configuraciónoperations · 4 h
Backups, restore testing, vaults e inmutabilidadreliability · 4 h
Administración remota sin SSH permanentesecurity · 4 h
Alertas, on-call, escalamiento y comunicaciónincident · 4 h
Triage de red, cómputo, datos y dependenciasincident · 4 h
Runbooks ejecutables y auto-remediationoperations · 4 h
Change management, ventanas y rollbackdelivery · 4 h
Game days, chaos engineering y aprendizajechaos · 4 h
Capacity planning, cuotas y gestión de demandacapacity · 4 h
AIOps, automatización asistida y límites humanosgovernance · 4 h
Proyecto: centro de operaciones de CloudShopcapstone · 8 h