Orquesta Agentes IA que desarrollan por ti
Verificando...
52-incident-postmortem
Procedimiento: Postmortem de Incidentes
Reportes
1 plugin(s)
Editor
Preview
Tareas
0
Info
Titulo
Facilita la creación de postmortems sin culpa. Documenta timeline, impacto, causa raíz, acciones correctivas, y lecciones aprendidas.
Descripcion
Contenido Markdown
8922 caracteres
Guardar
# Procedimiento: Postmortem de Incidentes ## Metadata - **ID**: PROC-52 - **Frecuencia**: Despu├®s de cada incidente P0/P1 - **Duraci├│n estimada**: 1-2 horas (reuni├│n + documento) - **Requiere**: Participantes del incidente, documentaci├│n del incidente - **Dependencias**: PROC-07 (incident investigation completado) - **Bloquea**: Cierre formal del incidente ## Objetivo Documentar lecciones aprendidas de incidentes significativos, identificar mejoras sist├®micas, y prevenir recurrencia. ## Cu├índo Hacer Postmortem | Criterio | Obligatorio | Opcional | |----------|-------------|----------| | P0 - Cr├¡tico (downtime > 1h) | S├¡ | | | P1 - Alto (degradaci├│n significativa) | S├¡ | | | P2 - Medio (funcionalidad afectada) | | S├¡ | | Incidente con aprendizaje valioso | | S├¡ | | Near-miss (casi incidente grave) | | S├¡ | ## Principios del Postmortem 1. **Blameless**: Enfocarse en sistemas, no en personas 2. **Honesto**: Documentar lo que realmente pas├│ 3. **Constructivo**: Orientado a mejoras concretas 4. **Accionable**: Cada lecci├│n tiene una acci├│n ## Checklist Ejecutable ### 1. Preparaci├│n (antes de reuni├│n) - [ ] Incidente resuelto (PROC-07 completado) - [ ] Documento de incidente existe (`docs/incidents/INC-XXX.md`) - [ ] Timeline preliminar documentado - [ ] Participantes identificados e invitados - [ ] Agenda enviada **Participantes sugeridos:** - Quien detect├│ el incidente - Quien investig├│/resolvi├│ - Owner del ├írea afectada - (Opcional) Product Owner si impacto alto ### 2. Reuni├│n de Postmortem (1h max) **Agenda:** ``` 1. Contexto (5 min) - Qu├® pas├│ (resumen de una l├¡nea) - Impacto (usuarios, duraci├│n, $) 2. Timeline (15 min) - Reconstruir secuencia de eventos - Identificar momentos clave 3. Root Cause Analysis (20 min) - 5 Whys - Factores contribuyentes 4. Qu├® funcion├│ bien (5 min) - Detecci├│n - Respuesta - Comunicaci├│n 5. Qu├® podr├¡a mejorar (10 min) - Detecci├│n m├ís temprana - Respuesta m├ís r├ípida - Prevenci├│n 6. Action Items (5 min) - Acciones concretas - Responsables - Fechas ``` - [ ] Reuni├│n realizada - [ ] Notas tomadas ### 3. Documentar Postmortem Crear `docs/postmortems/PM-INC-XXX.md`: ```markdown # Postmortem: INC-XXX - [T├¡tulo] ## Resumen Ejecutivo | Campo | Valor | |-------|-------| | **Fecha del incidente** | YYYY-MM-DD | | **Duraci├│n** | X horas | | **Impacto** | X usuarios, Y operaciones fallidas | | **Severidad** | P0 / P1 | | **Root Cause** | [Una l├¡nea] | | **Postmortem Date** | YYYY-MM-DD | | **Autor** | | ## Timeline | Hora (UTC) | Evento | |------------|--------| | HH:MM | [Primer s├¡ntoma observable] | | HH:MM | [Alerta/Detecci├│n] | | HH:MM | [Inicio investigaci├│n] | | HH:MM | [Root cause identificado] | | HH:MM | [Mitigaci├│n aplicada] | | HH:MM | [Resoluci├│n confirmada] | | HH:MM | [Incidente cerrado] | ## Impacto ### Usuarios afectados - X usuarios no pudieron [acci├│n] - Y operaciones fallaron ### Impacto en negocio - [P├®rdida estimada / oportunidad perdida] - [Impacto reputacional si aplica] ## Root Cause Analysis ### 5 Whys 1. **┬┐Por qu├® ocurri├│ el error?** - [Respuesta] 2. **┬┐Por qu├® [1]?** - [Respuesta] 3. **┬┐Por qu├® [2]?** - [Respuesta] 4. **┬┐Por qu├® [3]?** - [Respuesta] 5. **┬┐Por qu├® [4]?** - [Respuesta ÔåÆ Root Cause] ### Root Cause [Descripci├│n clara del root cause t├®cnico] ### Factores Contribuyentes - [Factor 1: ej. Falta de tests para ese caso] - [Factor 2: ej. Monitoreo insuficiente] - [Factor 3: ej. Documentaci├│n desactualizada] ## Respuesta al Incidente ### Qu├® funcion├│ bien - [Detecci├│n r├ípida por X] - [Comunicaci├│n efectiva entre equipos] - [Fix deployado en < X minutos] ### Qu├® podr├¡a mejorar - [Detecci├│n: podr├¡amos haber detectado antes si...] - [Respuesta: podr├¡amos haber resuelto antes si...] - [Prevenci├│n: podr├¡amos haber evitado si...] ## Lecciones Aprendidas 1. **Lecci├│n 1**: [Descripci├│n] - Acci├│n: [Qu├® hacer] 2. **Lecci├│n 2**: [Descripci├│n] - Acci├│n: [Qu├® hacer] ## Action Items | ID | Acci├│n | Responsable | Fecha | Estado | |----|--------|-------------|-------|--------| | AI-001 | [Acci├│n concreta] | @nombre | YYYY-MM-DD | Pendiente | | AI-002 | [Acci├│n concreta] | @nombre | YYYY-MM-DD | Pendiente | | AI-003 | [Acci├│n concreta] | @nombre | YYYY-MM-DD | Pendiente | ### Categor├¡as de Action Items - **Prevenci├│n**: Evitar que vuelva a ocurrir - **Detecci├│n**: Detectar m├ís r├ípido si ocurre - **Mitigaci├│n**: Reducir impacto si ocurre - **Proceso**: Mejorar respuesta a incidentes ## Referencias - Incidente: [docs/incidents/INC-XXX.md](../incidents/INC-XXX.md) - Sentry: [link] - PR del fix: [link] - Slack thread: [link] --- *Este postmortem sigue la filosof├¡a blameless. El objetivo es mejorar sistemas, no se├▒alar individuos.* ``` - [ ] Documento de postmortem creado ### 4. Crear tickets para Action Items ```bash # Para cada action item, crear ticket en sistema de tracking # Con referencia al postmortem ``` | Action Item | Ticket # | |-------------|----------| | AI-001 | | | AI-002 | | | AI-003 | | - [ ] Tickets creados para todos los action items ### 5. Comunicar resultados - [ ] Postmortem compartido con equipo - [ ] Resumen enviado a stakeholders (si P0/P1) - [ ] Lecciones a├▒adidas a documentaci├│n relevante ### 6. Seguimiento Programar revisi├│n de action items: ``` - 1 semana: Verificar progreso de items urgentes - 1 mes: Verificar completitud de todos los items - 3 meses: Verificar que no hay recurrencia ``` - [ ] Recordatorio programado para seguimiento ## Plantilla de Email para Stakeholders ``` Asunto: [Postmortem] INC-XXX - [T├¡tulo breve] Resumen: El [fecha] tuvimos un incidente que afect├│ a [X usuarios/funcionalidad] durante [X horas]. Root Cause: [Una o dos l├¡neas explicando la causa] Acciones tomadas: - [Fix aplicado] - [Medidas preventivas implementadas] Pr├│ximos pasos: - [Action items principales] El postmortem completo est├í disponible en [link]. Si tienen preguntas, no duden en contactarnos. ``` ## Anti-patrones a Evitar | No hacer | Hacer en su lugar | |----------|-------------------| | "Juan cometi├│ el error" | "El proceso no detect├│ el error antes de deploy" | | "Debimos haber sabido" | "Podemos a├▒adir alerta para detectar esto" | | "No volver├í a pasar" | "Implementaremos X para prevenirlo" | | Action items vagos | Action items espec├¡ficos con fecha y responsable | | Postmortem sin seguimiento | Revisar action items en 1 semana | ## Resultado - **├ëxito**: Postmortem documentado, action items creados y asignados - **Parcial**: Postmortem documentado, action items pendientes de asignar - **Fallo**: No se pudo completar ÔåÆ reprogramar reuni├│n ## Mensaje de Finalizaci├│n **IMPORTANTE - ACCI├ôN REQUERIDA AL FINALIZAR:** Cuando hayas completado todos los pasos de este procedimiento, DEBES ejecutar el siguiente comando usando la herramienta Bash: Ejecuta: `echo "====== PROCESO TERMINADO [$(date +%H%M%S)] ======" && echo "RESULTADO: Postmortem INC-XXX completado, X action items creados"` Sustituye INC-XXX y X por los valores reales. --- ## Output Estructurado (Nexus) Al finalizar, el agente DEBE generar un bloque JSON con el siguiente formato para que Nexus pueda procesarlo automaticamente: ```json { "result": "success", "summary": "Ejecucion de PROC-52 completada. [Descripcion breve de resultados]", "metrics": { "issues_found": 0, "issues_resolved": 0, "incident_duration_min": 45, "services_affected": 2, "custom": { "procedure_specific_metric": "value" } }, "backlog_items": [ { "title": "Titulo del item de seguimiento", "description": "Descripcion detallada si se requiere accion futura", "priority": "medium", "type": "improvement", "tags": ["proc-52"] } ], "next_steps": [ "Accion recomendada 1", "Accion recomendada 2" ], "warnings": [ "Advertencias encontradas durante la ejecucion" ] } ``` **Campos requeridos:** - `result`: `"success"` | `"partial"` | `"failed"` - `summary`: Resumen ejecutivo en 1-3 lineas **Metricas especificas de este procedure:** - action_items_total, action_items_completed, lessons_documented **Criterios de resultado:** - `success`: Procedimiento completado sin errores criticos - `partial`: Completado con algunos problemas menores o items pendientes - `failed`: Error critico o no se pudo completar ## Historial de Postmortems | Fecha | Incidente | Severidad | Action Items | Completados | |-------|-----------|-----------|--------------|-------------| | | | | | |
H1
H2
H3
Bold
Italic
Code
Lista
Num
Task
Code Block
Link
Nexus Platform
Reconectando
Recuperando la conexion
Se ha interrumpido la conexion con el servidor. Estamos reconectando automaticamente.
Reconectando...
Manten esta pestana abierta, volvemos enseguida.
No hemos podido reconectar
El servidor puede estar reiniciandose o tu conexion a internet es inestable.
Reintentar
La sesion ha expirado
Recarga la pagina para iniciar una nueva sesion.
Recargar
Si no vuelve en 30 segundos, recarga la pagina.