Contexto#

Trabalho de infraestrutura cloud onde eu era o ponto focal entre infra e o time de desenvolvimento — precisava diagnosticar problema de rede, latência e timeout em produção rápido, sem depender de “acho que é o banco” ou “acho que é a rede”.

Solução: cada camada com sua ferramenta certa, tudo correlacionável.


Camadas#

  • Zabbix — saúde da infraestrutura (servidores, rede)
  • Grafana + Telegraf — dashboards em tempo real de aplicação
  • Loki — centralização de logs
  • Percona PMM — análise profunda de banco de dados (queries lentas, locks, índices)

Onde isso importou de verdade#

  • Migração do MongoDB Atlas para solução autogerenciada em EC2 — decisão baseada em dados reais de custo e performance coletados pelo PMM, não achismo
  • Ambiente escalável na AWS (ALB, Auto Scaling Groups, RDS, ElastiCache) — desenhado e operado com visibilidade completa do que cada componente consumia
  • Segurança e confiabilidade — VPC/IAM, backups e revisão de incidentes apoiados pelos mesmos dashboards

Resultado#

  • Diagnóstico de problema de rede/latência deixou de ser “abrir 4 ferramentas diferentes” pra ser um fluxo único
  • Migração de banco decidida com dado, não com medo
  • Colaboração contínua com o time de Dev/Ops em vez de infra isolada apagando incêndio

Tecnologias#

Zabbix · Grafana · Telegraf · Loki · Percona PMM · AWS (ALB, ASG, RDS, ElastiCache) · MongoDB