A federação não requer um service mesh ou ferramentas externas. O operator
se conecta diretamente a cada cluster via kubeconfig armazenado em Secrets.
Por que Federação Multi-Cluster?
Em ambientes de produção modernos, a infraestrutura raramente se limita a um único cluster:Multi-Região
Clusters em us-east-1, eu-west-1 e ap-southeast-1 para latência e
compliance regionais.
Multi-Ambiente
Staging, production e DR em clusters separados com diferentes políticas de
segurança.
Multi-Tenant
Clusters dedicados por equipe ou produto com isolamento forte de workloads.
- Detectar que o mesmo problema afeta 5 clusters simultaneamente
- Correlacionar um deploy em staging com uma falha em produção
- Aplicar políticas de remediação diferenciadas por importância do cluster
- Agregar métricas de saúde em uma visão global
ClusterRegistration CRD
O CRDClusterRegistration é o ponto de entrada para adicionar clusters à federação.
Especificação Completa
Campos do Spec
Campos do Status
Como a Federação Funciona
Kubeconfig Parsing
O controller lê o kubeconfig do Secret referenciado e cria um client Kubernetes configurado para o cluster remoto.Cache de Clients Remotos
Os clients são armazenados em umsync.Map para reutilização, evitando reconexões desnecessárias:
Health Check Loop
O controller executa health checks periódicos em cada cluster registrado:1
Lista Nodes
Executa
List Nodes no cluster remoto para verificar conectividade e contar
nodes ativos.2
Lista Namespaces
Executa
List Namespaces para contar namespaces e verificar permissões
RBAC.3
Atualiza Status
Atualiza o
ClusterRegistration.Status com os resultados, incluindo
connected, nodeCount, namespaceCount e kubernetesVersion.4
Gera Métricas
Exporta métricas Prometheus com o estado do cluster.
Correlação Cross-Cluster
Um dos recursos mais poderosos da federação é a capacidade de correlacionar incidentes entre clusters.Elevação Automática de Severidade
Quando o mesmosignalType é detectado em 3 ou mais clusters dentro de uma janela de tempo, a plataforma eleva automaticamente a severidade para critical:
CorrelationID Annotation
Quando incidentes são correlacionados entre clusters, todos recebem a mesma annotationcorrelationID para rastreabilidade:
O
correlationID permite que operadores façam kubectl queries para encontrar
todos os incidentes relacionados em todos os clusters:Detecção de Cascata
A detecção de cascata identifica quando um problema em um ambiente de menor tier (staging) pode estar prestes a afetar um ambiente de maior tier (produção).Staging para Produção
platform.chatcli.io/cascade-detected: true é adicionada ao Issue em produção:
Agregação de Status Global
O operator mantém um status agregado de toda a federação, acessível via CRD e API:- kubectl
- API REST
Política de Remediação por Tier
Cada cluster tem uma política de remediação baseada no seutier, que controla o nível de autonomia permitido pelo Motor de Decisão.
Definição de Políticas
A política por tier é avaliada antes do Motor de Decisão calcular
confiança. Se o tier exige aprovação manual, o cálculo de confiança ainda
é feito (para registro e auditoria), mas o resultado não altera a decisão.
Exemplos YAML
Registrar Cluster de Produção
Registrar Cluster de Staging
Setup Multi-Região Completo
Monitoramento da Federação
Métricas Prometheus
Dashboards Recomendados
Grafana Dashboard: Federation Overview
Grafana Dashboard: Federation Overview
Alertas Recomendados
Arquitetura de Rede
Próximos Passos
Motor de Decisão
Entenda como a confiança é calculada e como as políticas por tier afetam as
decisões.
Chaos Engineering
Execute experimentos de chaos em clusters específicos com safety checks por
tier.
Auditoria e Compliance
Audit trail completo de ações cross-cluster com correlationID.
AIOps Platform
Retorne à visão geral da plataforma AIOps.