Web Dashboard
Visão Geral
O Web Dashboard é uma Single Page Application embutida diretamente no binário do operator via Goembed.FS — não requer Node.js, npm ou qualquer build frontend separado.
O dashboard consume a mesma API REST documentada em API Reference. Todas as operações disponíveis no dashboard (acknowledge, snooze, approve, reject) são chamadas REST autenticadas.
Arquitetura
Views do Dashboard
O dashboard possui 10 views acessíveis via navegação por tabs:1. Overview
1. Overview
Visão geral da plataforma com métricas agregadas.Componentes:
O Overview fornece consciencia situacional abrangente com métricas de compliance, capacidade e efetividade de remediação.
2. Incidents
2. Incidents
Tabela interativa de todos os incidentes com filtros e ações.Funcionalidades:
Badges de severidade:
Badges de estado:
Badges inline (após o nome):
3. SLOs
3. SLOs
Cards de SLOs com indicadores visuais de error budget e burn rate.Componentes por SLO:
Thresholds de Burn Rate (Google SRE):
4. Approvals
4. Approvals
Lista de aprovações pendentes com ações de aprovar/rejeitar.Funcionalidades:
5. AI Insights
5. AI Insights
Visualize todas as analises geradas pela IA para entender como ela raciocinou sobre cada incidente.Funcionalidades:
Esta view é essencial quando um incidente é escalado para ação humana — mostra exatamente o que a IA encontrou, porque recomendou ações específicas, e quais dados de enriquecimento informaram sua análise.Endpoint da API:
GET /api/v1/aiinsights6. Remediations
6. Remediations
Acompanhe todos os planos de remediação com detalhes de execução, tanto baseados em runbook quanto em modo agêntico.Funcionalidades:
Endpoint da API:
GET /api/v1/remediations7. Runbooks
7. Runbooks
Visualize todos os runbooks — tanto criados manualmente quanto gerados automaticamente pela IA após remediações bem-sucedidas.Funcionalidades:
Runbooks servem como a “memória institucional” da IA — quando um incidente similar ocorre no futuro, a plataforma o corresponde a um runbook existente em vez de começar do zero, reduzindo significativamente o MTTR.Endpoint da API:
GET /api/v1/runbooks8. PostMortems
8. PostMortems
Lista de post-mortems com detalhes expansíveis.Funcionalidades:
9. Clusters
9. Clusters
Cards de clusters monitorados com status de saúde.Componentes por cluster:
10. Audit
10. Audit
Log de auditoria pesquisável com exportação.Funcionalidades:
Grafana Dashboards
A plataforma AIOps inclui 4 dashboards Grafana pré-configurados em formato JSON, prontos para importação.1. AIOps Overview (aiops-overview.json)
Dashboard principal com visão geral operacional.
Painéis:
Variáveis de template:
2. SLO Burn Rate (slo-burn-rate.json)
Dashboard dedicado a SLOs seguindo o modelo Google SRE.
Painéis:
Threshold lines (anotações):
Cada gráfico de burn rate inclui uma linha horizontal vermelha tracejada no threshold correspondente (modelo Google SRE de multi-window, multi-burn-rate alerting).
3. Incident Timeline (incident-timeline.json)
Dashboard focado no fluxo temporal de incidentes e notificações.
Painéis:
4. Remediation Stats (remediation-stats.json)
Dashboard detalhado sobre o desempenho das remediações.
Painéis:
Instalação dos Dashboards Grafana
Via Grafana Sidecar (Recomendado)
Se você usa o Grafana Helm chart com sidecar habilitado, crie ConfigMaps com o labelgrafana_dashboard: "1":
O sidecar do Grafana detecta automaticamente ConfigMaps com o label
grafana_dashboard: "1" e importa os dashboards sem restart.Via Importação Manual
- Acesse Grafana > Dashboards > Import
- Faça upload do arquivo JSON ou cole o conteúdo
- Selecione o datasource Prometheus
- Clique em Import
ServiceMonitor para Prometheus Operator
Configure o scraping de métricas do operator:Referência de Métricas Prometheus
O operator expõe as seguintes métricas Prometheus para alimentar os dashboards Grafana:Queries Prometheus Úteis
Exemplos de queries PromQL para usar nos dashboards ou alertas:MTTR por severidade (últimas 24h)
MTTR por severidade (últimas 24h)
Taxa de sucesso de remediação
Taxa de sucesso de remediação
Burn rate do SLO (alerta multi-window)
Burn rate do SLO (alerta multi-window)
Custo LLM acumulado por hora
Custo LLM acumulado por hora
Anomalias suprimidas vs. processadas
Anomalias suprimidas vs. processadas
Recursos próximos de esgotamento (menos de 7 dias)
Recursos próximos de esgotamento (menos de 7 dias)
Acesso ao Dashboard
1
Verificar o operator
Confirme que o operator está rodando:
2
Port-forward (desenvolvimento)
Para acesso local durante desenvolvimento:Acesse:
http://localhost:8090/3
Ingress (produção)
Para acesso em produção, configure um Ingress:
4
Configurar API Key
Configure ao menos uma API key antes de expor o dashboard externamente:Após criar o ConfigMap, reinicie o operator para carregar as chaves:
Próximo Passo
API REST Reference
Referência completa de todos os endpoints consumidos pelo dashboard.
Capacity & Custos
Detalhes do Capacity Planner, Noise Reducer e Cost Tracker.
AIOps Platform
Arquitetura completa do pipeline de operações autônomas.
K8s Operator
Configuração e deployment do operator Kubernetes.