CodexScribo

O sistema está lento e a conta da nuvem está subindo.

Geralmente é a mesma causa.

Engenharia para plataformas de alta vazão: latência previsível, escala multi-região e custo sob controle. Conduzida pelo engenheiro principal, não repassada para um time júnior.

20 anos
em sistemas de missão crítica, baixa latência e alta escala
4 bilhões/dia
de mensagens entregues em produção
picos de 200 mil/s
em clusters multi-região

Latência e custo quase nunca são dois problemas

Quando a latência de cauda sobe, a reação padrão é adicionar máquina. Funciona o suficiente para esconder a causa e custa o suficiente para aparecer na fatura.

Três meses depois o sistema está mais lento e a conta está maior, porque a máquina extra não corrigiu o retry que amplifica a carga no pico, o pool de conexões que satura antes da CPU, nem a chamada entre regiões que entrou num caminho quente sem ninguém notar. O provisionamento virou o curativo permanente de um bug que ninguém foi procurar.

São os mesmos dois sintomas de uma causa só: ninguém sabe com precisão o que a máquina está fazendo. A maioria dos times trata o computador como caixa-preta — e paga por isso duas vezes, em segundos e em reais.

O que eu procuro quando abro um sistema

  • Comportamento de cauda, não média. p99 e p99.9 sob carga sustentada. A média esconde exatamente o cliente que está reclamando.

  • Amplificação. Retries sem backoff, timeouts mal calibrados, thundering herd na recuperação, fila que cresce mais rápido do que drena.

  • Topologia. O que atravessa região dentro do caminho quente e não precisava atravessar. Latência entre regiões é conquistada, não é de graça.

  • Onde o dinheiro mora. Instância superdimensionada para mascarar defeito, egress desnecessário, classe de storage errada, ociosidade que ninguém mede.

  • O que a máquina faz de fato. Alocação, pausas de GC, syscalls, cache miss, contenção de lock. É a camada onde os dois problemas se encontram.

Três estágios, nessa ordem

  1. 01

    Auditoria

    2 a 3 semanas, escopo fixo. Você recebe um diagnóstico que pode executar com o seu próprio time.

    Auditoria →

  2. 02

    Projeto de escopo fixo

    O conserto que a auditoria identificou, com escopo já validado por ela.

    Projetos →

  3. 03

    Parceria

    Propriedade contínua do sistema, para quando performance e custo passam a ser trabalho permanente.

    Parceria →

A ordem importa: cada estágio existe para você decidir sobre o próximo com informação, e não com base numa promessa.

Comece pelo diagnóstico

Duas a três semanas, escopo fixo, sem obrigação de contratar o conserto.

Escolha quais categorias você autoriza. Sua escolha fica registrada neste navegador.