Alta Disponibilidade & Resiliência

Arquitetura de Alta Disponibilidade (HA) com F5 BIG-IP e Docker Swarm

Estratégias práticas que resultaram em redução de 90% no tempo de recuperação (MTTR), eliminação de pontos únicos de falha e failover contínuo para aplicações críticas.

Carlos Felipe
Carlos Felipe Oliveira da Silva Senior Infrastructure & DevOps Engineer
Resiliência Sem Degradação: Em sistemas empresariais com milhares de transações simultâneas, tolerância a falhas significa que panes em servidores físicos ou instâncias de contêineres devem ser absorvidas sem desconectar os usuários nem interromper operações em andamento.

1. O Cenário: Eliminação de SPOF (Single Point of Failure)

Plataformas legadas frequentemente concentram todo o tráfego em um único gateway ou instância de proxy reverso. Quando ocorre uma falha de hardware ou esgotamento de conexões, toda a operação fica paralisada, resultando em perdas financeiras imediatas e violação de SLAs contratuais.

2. Topologia Active/Standby com F5 BIG-IP

A camada de borda e balanceamento de carga foi implementada com um par de appliances F5 BIG-IP LTM (Local Traffic Manager) configurados em cluster sincronizado:

  • State Synchronization Contínua: A tabela de conexões e sessões de usuários é espelhada continuamente entre o nó ativo e o nó passivo via link de rede dedicado (ConfigSync & Network Failover).
  • Health Monitors Sintéticos: Em vez de simples testes de ping (ICMP), os monitores executam requisições HTTP simuladas que validam se a aplicação consegue consultar o banco de dados antes de direcionar o tráfego.
  • SSL Offloading Otimizado: Terminação TLS acelerada por hardware no F5, descarregando os nós de aplicação e simplificando a renovação centralizada de certificados.

3. Orquestração com Docker Swarm e Auto-Healing

Na camada de microsserviços, o Docker Swarm foi estruturado em nós de gerenciamento e trabalhadores distribuídos em diferentes hipervisores VMware:

# docker-stack.yml - Resiliência e auto-recuperação
version: '3.8'
services:
  web_core:
    image: app/core:latest
    deploy:
      replicas: 6
      update_config:
        parallelism: 2
        delay: 15s
        order: start-first
        failure_action: rollback
      restart_policy:
        condition: on-failure
        delay: 5s
        max_attempts: 3
        window: 120s
    healthcheck:
      test: ["CMD", "curl", "-f", "http://localhost:8080/health"]
      interval: 10s
      timeout: 3s
      retries: 3
      start_period: 30s

4. Testes de Falha e Validação de Disaster Recovery

Foram executados testes de estresse e Chaos Engineering simulando a queda abrupta de um nó do F5 BIG-IP e o desligamento repentino de hosts físicos do Swarm:

Failover Sub-Segundo

O nó secundário do F5 assumiu o tráfego em menos de 400 milissegundos sem queda de conexões ativas.

Rebalanceamento Autônomo

O Swarm reprogramou réplicas perdidas em nós saudáveis em menos de 10 segundos.

Resultado Estratégico

O tempo médio de recuperação (MTTR) foi reduzido em 90%, assegurando 99.99% de disponibilidade (alta resiliência) mesmo durante janelas de manutenção de infraestrutura.