Anatomia de um Incidente
Cenário: OOMKill em Produção
1. Detecção Automática
O Watcher detecta que pods dopayment-service estão sendo OOMKilled:
2. Issue Criada
O CorrelationEngine agrupa as anomalias em um Issue:Ver detalhes do Issue
Ver detalhes do Issue
3. Notificação Enviada
O Slack recebe automaticamente:High Severity: OOM Kill DetectedIssue: INC-20260319-001 | 2026-03-19T15:20:00Z
4. IA Analisa o Problema
5. Aprovação Necessária
O ApprovalPolicy requer aprovação para mudanças de recursos em produção:http://localhost:8090 → Approvals → Approve com motivo.
Opção B — Aprovar via REST API:
6. Remediação Executada
Após aprovação, o RemediationReconciler executa:- Captura
ResourceSnapshotestruturado (replicas, images, CPU/memory requests+limits, HPA min/max) - Cria
ActionCheckpointantes de cada ação - Aplica
AdjustResources(memory 512Mi → 1Gi) - Aguarda 90s verificando deployment health
readyReplicas >= desired→ Completed
7. Issue Resolvida
- Slack recebe notificação de resolução
- Pattern Store registra: “oom_kill + Deployment + high → AdjustResources funciona”
- Dedup cooldown de 10min ativado (configurável via
aiops.resolutionCooldownMinutes)
8. PostMortem Automático
Ver PostMortem completo
Ver PostMortem completo