Skip to main content
A Federação Multi-Cluster permite que a plataforma AIOps do ChatCLI gerencie múltiplos clusters Kubernetes a partir de um único plano de controle. Incidentes são correlacionados entre clusters, cascatas são detectadas automaticamente e políticas de remediação respeitam o tier de cada ambiente.
A federação não requer um service mesh ou ferramentas externas. O operator se conecta diretamente a cada cluster via kubeconfig armazenado em Secrets.

Por que Federação Multi-Cluster?

Em ambientes de produção modernos, a infraestrutura raramente se limita a um único cluster:

Multi-Região

Clusters em us-east-1, eu-west-1 e ap-southeast-1 para latência e compliance regionais.

Multi-Ambiente

Staging, production e DR em clusters separados com diferentes políticas de segurança.

Multi-Tenant

Clusters dedicados por equipe ou produto com isolamento forte de workloads.
Sem federação, cada cluster é um silo. A AIOps perde a capacidade de:
  • Detectar que o mesmo problema afeta 5 clusters simultaneamente
  • Correlacionar um deploy em staging com uma falha em produção
  • Aplicar políticas de remediação diferenciadas por importância do cluster
  • Agregar métricas de saúde em uma visão global

ClusterRegistration CRD

O CRD ClusterRegistration é o ponto de entrada para adicionar clusters à federação.

Especificação Completa

Campos do Spec

Campos do Status

Como a Federação Funciona

Kubeconfig Parsing

O controller lê o kubeconfig do Secret referenciado e cria um client Kubernetes configurado para o cluster remoto.

Cache de Clients Remotos

Os clients são armazenados em um sync.Map para reutilização, evitando reconexões desnecessárias:

Health Check Loop

O controller executa health checks periódicos em cada cluster registrado:
1

Lista Nodes

Executa List Nodes no cluster remoto para verificar conectividade e contar nodes ativos.
2

Lista Namespaces

Executa List Namespaces para contar namespaces e verificar permissões RBAC.
3

Atualiza Status

Atualiza o ClusterRegistration.Status com os resultados, incluindo connected, nodeCount, namespaceCount e kubernetesVersion.
4

Gera Métricas

Exporta métricas Prometheus com o estado do cluster.

Correlação Cross-Cluster

Um dos recursos mais poderosos da federação é a capacidade de correlacionar incidentes entre clusters.

Elevação Automática de Severidade

Quando o mesmo signalType é detectado em 3 ou mais clusters dentro de uma janela de tempo, a plataforma eleva automaticamente a severidade para critical:

CorrelationID Annotation

Quando incidentes são correlacionados entre clusters, todos recebem a mesma annotation correlationID para rastreabilidade:
O correlationID permite que operadores façam kubectl queries para encontrar todos os incidentes relacionados em todos os clusters:

Detecção de Cascata

A detecção de cascata identifica quando um problema em um ambiente de menor tier (staging) pode estar prestes a afetar um ambiente de maior tier (produção).

Staging para Produção

Quando uma cascata é detectada, a annotation platform.chatcli.io/cascade-detected: true é adicionada ao Issue em produção:
Cascatas detectadas elevam automaticamente a prioridade da issue e adicionam contexto extra ao prompt do LLM, incluindo o histórico do incidente no cluster de origem. Isso permite que a IA recomende ações preventivas baseadas no que aconteceu no staging.

Agregação de Status Global

O operator mantém um status agregado de toda a federação, acessível via CRD e API:

Política de Remediação por Tier

Cada cluster tem uma política de remediação baseada no seu tier, que controla o nível de autonomia permitido pelo Motor de Decisão.

Definição de Políticas

A política por tier é avaliada antes do Motor de Decisão calcular confiança. Se o tier exige aprovação manual, o cálculo de confiança ainda é feito (para registro e auditoria), mas o resultado não altera a decisão.

Exemplos YAML

Registrar Cluster de Produção

Registrar Cluster de Staging

Setup Multi-Região Completo

Monitoramento da Federação

Métricas Prometheus

Dashboards Recomendados

Alertas Recomendados

Arquitetura de Rede

O cluster de controle precisa de conectividade de rede para o API server de cada cluster remoto. Em ambientes com rede restrita, considere usar um bastion host ou VPN dedicada para o tráfego de gerenciamento.

Próximos Passos

Motor de Decisão

Entenda como a confiança é calculada e como as políticas por tier afetam as decisões.

Chaos Engineering

Execute experimentos de chaos em clusters específicos com safety checks por tier.

Auditoria e Compliance

Audit trail completo de ações cross-cluster com correlationID.

AIOps Platform

Retorne à visão geral da plataforma AIOps.