Cenário
Aplicação em Produção
Aplicação “myapp” rodando em produção no Kubernetes
Diagnóstico Rápido
Equipe precisa diagnosticar problemas rapidamente
Análise com IA
Usar IA para analisar logs, eventos e métricas
Contexto Automático
Contexto K8s automático em todas as perguntas
Opção 1: Monitoramento Local
Use esta opção quando você tem acesso direto ao cluster viakubectl.
1
Verificar Acesso ao Cluster
2
Iniciar o Watcher
3
Fazer Perguntas
4
Diagnosticar Problemas
Quando algo dá errado:
Opção 2: Servidor com Watcher (Equipe)
Use esta opção para que toda a equipe tenha acesso ao monitoramento via servidor centralizado.1
Deploy no Kubernetes
- Via Helm (single-target)
- Via Operator (AIOps)
2
Equipe Conecta
3
Contexto Automático
Qualquer pergunta feita por qualquer dev já inclui automaticamente o contexto K8s:
Fluxo de Trabalho: Incidente em Produção
1
Alerta Disparado
Você recebe um alerta do Grafana/PagerDuty/Slack sobre problemas no deployment.
2
Conectar ao ChatCLI
3
Obter Visão Geral
4
Investigar Causa Raiz
5
Receber Recomendações
6
Validar Resolução
Ajuste Fino dos Parâmetros
Intervalo de Coleta
Janela de Observação
Linhas de Log
One-Shot para Scripts e Alertas
Integre o ChatCLI com seu sistema de alertas:Dicas Avançadas
Combinar com Contextos Persistentes
Combinar com Contextos Persistentes
Salve documentação do projeto como contexto e anexe ao usar com o watcher:
Múltiplos Deployments
Múltiplos Deployments
Use o modo multi-target para monitorar tudo em uma única instância:A IA recebe contexto detalhado dos targets com problemas e resumos compactos dos saudáveis, respeitando o budget de
maxContextChars.Métricas Prometheus
Métricas Prometheus
Quando
metricsPort está configurado, o watcher scrapa automaticamente o endpoint /metrics dos pods e inclui as métricas na análise. Use metricsFilter com glob patterns para selecionar apenas métricas relevantes:Opção 3: AIOps Autônomo (Operator)
Use esta opção para remediação automática de problemas sem intervenção humana.1
Instalar o Operator
2
Criar Instance com Watcher
3
Monitorar o Pipeline
4
Fluxo Autônomo em Ação
Quando um pod começa a crashar:Tudo acontece automaticamente sem intervenção humana. Runbooks auto-gerados são reutilizados para futuras ocorrências do mesmo tipo. No modo agêntico, a IA atua como agente autônomo com “skills” K8s, e ao resolver o problema gera um PostMortem CR com timeline completa e um Runbook reutilizável para futuras ocorrências.
5
(Opcional) Adicionar Runbooks
Para cenários específicos onde você quer controlar exatamente o que fazer:
Prioridade de remediação: Runbook manual > Runbook auto-gerado > Remediação agêntica > Escalação. Quando não há Runbook manual, a IA gera automaticamente um Runbook CR reutilizável. Se nem Runbook nem ações de IA estão disponíveis, o operator entra em modo agêntico: a IA atua como agente autônomo num loop observe-decide-act, e ao resolver gera um PostMortem CR e um Runbook reutilizável.
Checklist de Implantação
- Monitoramento (Watch + Servidor)
- AIOps Autônomo (Operator)
- Verificar acesso ao cluster (
kubectl get pods) - Verificar permissões RBAC para pods, logs, eventos
- Escolher modo: local (
chatcli watch) ou servidor (chatcli server) - Definir targets: single (
--deployment) ou multi (--config targets.yaml) - (Opcional) Configurar
metricsPortpara Prometheus scraping - Configurar intervalo e janela adequados ao cenário
- Ajustar
maxContextCharsse necessário (padrão: 32000) - Testar com pergunta simples: “O deployment está saudável?”
- (Opcional) Integrar com alertas para análise automática
- (Opcional) Distribuir acesso para a equipe via token