Atlassian migra plataforma de métricas com 100 mil hosts para opentelemetry SEM romper SLO de 99,95%

2 min
Atlassian migra plataforma de métricas com 100 mil hosts para opentelemetry SEM romper SLO de 99,95%

A Atlassian reconstruiu sua pipeline de métricas sobre o OpenTelemetry Collector, atendendo 100 mil hosts em 14 regiões e reduzindo 96% do volume de dados, sem migrar aplicações.

A Site oficial da Atlassian (www.atlassian.com) reconstruiu sua plataforma de métricas sobre o OpenTelemetry everywhere: migrating a metrics platform at... (www.cncf.io) Collector, atendendo 100 mil hosts em 14 regiões com redução de 96% no volume de dados, sem interromper o SLO de 99,95% que protege os alertas de produção.

  • Atlassian trocou o gostatsd pelo OpenTelemetry Collector mantendo a interface StatsD-over-UDP, evitando uma migração organizacional ampla.
  • A plataforma atende cerca de 100 mil hosts em 14 regiões, com SLO de 99,95% preservado.
  • A agregação reduziu o volume de 4,8 bilhões de pontos/minuto para 220 milhões, cerca de 96% de corte.
  • Consolidar métricas no sidecar de tracing cortou cerca de 30% do custo de sidecars na frota.
  • O processador de agregação próprio foi aberto no GitHub como atlassian-aggregation-processor no GitHub (github.com).

Por que a atlassian abandonou o gostatsd?

O gostatsd funcionou de forma confiável por anos, mas seu design exclusivo em UDP não suporta traces nem logs, e manter a ferramenta exigiria reimplementar recursos que a comunidade do OpenTelemetry Collector já oferece. A decisão técnica preservou a interface StatsD e reconstruiu tudo por trás dela.

Quatro estágios de collector reduziram custo e volume

Distribuições dedicadas de coleta, ingestão, agregação e encaminhamento permitiram alterar camadas isoladamente. A agregação cortou 96% do volume de dados, e o tier revisado usa metade da CPU para o mesmo tráfego.

  • Coleta: sidecar consolidado com tracing, economia média de 3,9% de CPU nos serviços mais caros
  • Ingestão: hash por stream ID com o load-balancing exporter do contrib
  • Agregação: processador delta customizado, open-sourced no GitHub
  • Encaminhamento: metrics-gateway stateless, com retry, fila e backpressure

Estratégia de rollout e comparação de mercado

Rollout em fases de 1%, 10%, 50% e 100% começou por dev e staging. Airbnb e Skyscanner seguiram rotas diferentes, mas todas separaram migração de aplicações da troca de infraestrutura central.

D

· Editor-chefe

Especialista em tecnologia, criador de conteúdo e fundador do portal Mercado de TI e Casa do Dev. Analiso tendências de mercado, Inteligência Artificial e carreira, entregando informações precisas, tr...

LinkedIn Site

COMPARTILHAR