Skip to main content
Nesta receita, você vai configurar o ChatCLI para monitorar um deployment Kubernetes e usar IA para diagnosticar problemas em tempo real.

Cenário

Aplicação em Produção

Aplicação “myapp” rodando em produção no Kubernetes

Diagnóstico Rápido

Equipe precisa diagnosticar problemas rapidamente

Análise com IA

Usar IA para analisar logs, eventos e métricas

Contexto Automático

Contexto K8s automático em todas as perguntas

Opção 1: Monitoramento Local

Use esta opção quando você tem acesso direto ao cluster via kubectl.
1

Verificar Acesso ao Cluster

2

Iniciar o Watcher

Você verá:
3

Fazer Perguntas

4

Diagnosticar Problemas

Quando algo dá errado:

Opção 2: Servidor com Watcher (Equipe)

Use esta opção para que toda a equipe tenha acesso ao monitoramento via servidor centralizado.
1

Deploy no Kubernetes

2

Equipe Conecta

3

Contexto Automático

Qualquer pergunta feita por qualquer dev já inclui automaticamente o contexto K8s:

Fluxo de Trabalho: Incidente em Produção

1

Alerta Disparado

Você recebe um alerta do Grafana/PagerDuty/Slack sobre problemas no deployment.
2

Conectar ao ChatCLI

3

Obter Visão Geral

4

Investigar Causa Raiz

5

Receber Recomendações

6

Validar Resolução


Ajuste Fino dos Parâmetros

Intervalo de Coleta

Janela de Observação

Linhas de Log


One-Shot para Scripts e Alertas

Integre o ChatCLI com seu sistema de alertas:
Ou via servidor remoto:

Dicas Avançadas

Salve documentação do projeto como contexto e anexe ao usar com o watcher:
Use o modo multi-target para monitorar tudo em uma única instância:
A IA recebe contexto detalhado dos targets com problemas e resumos compactos dos saudáveis, respeitando o budget de maxContextChars.
Quando metricsPort está configurado, o watcher scrapa automaticamente o endpoint /metrics dos pods e inclui as métricas na análise. Use metricsFilter com glob patterns para selecionar apenas métricas relevantes:

Opção 3: AIOps Autônomo (Operator)

Use esta opção para remediação automática de problemas sem intervenção humana.
1

Instalar o Operator

2

Criar Instance com Watcher

3

Monitorar o Pipeline

4

Fluxo Autônomo em Ação

Quando um pod começa a crashar:
Tudo acontece automaticamente sem intervenção humana. Runbooks auto-gerados são reutilizados para futuras ocorrências do mesmo tipo. No modo agêntico, a IA atua como agente autônomo com “skills” K8s, e ao resolver o problema gera um PostMortem CR com timeline completa e um Runbook reutilizável para futuras ocorrências.
5

(Opcional) Adicionar Runbooks

Para cenários específicos onde você quer controlar exatamente o que fazer:
Prioridade de remediação: Runbook manual > Runbook auto-gerado > Remediação agêntica > Escalação. Quando não há Runbook manual, a IA gera automaticamente um Runbook CR reutilizável. Se nem Runbook nem ações de IA estão disponíveis, o operator entra em modo agêntico: a IA atua como agente autônomo num loop observe-decide-act, e ao resolver gera um PostMortem CR e um Runbook reutilizável.

Checklist de Implantação

  • Verificar acesso ao cluster (kubectl get pods)
  • Verificar permissões RBAC para pods, logs, eventos
  • Escolher modo: local (chatcli watch) ou servidor (chatcli server)
  • Definir targets: single (--deployment) ou multi (--config targets.yaml)
  • (Opcional) Configurar metricsPort para Prometheus scraping
  • Configurar intervalo e janela adequados ao cenário
  • Ajustar maxContextChars se necessário (padrão: 32000)
  • Testar com pergunta simples: “O deployment está saudável?”
  • (Opcional) Integrar com alertas para análise automática
  • (Opcional) Distribuir acesso para a equipe via token