Observabilidade ponta a ponta: Zabbix + Grafana/Telegraf + Loki + Percona PMM
Contexto#
Trabalho de infraestrutura cloud onde eu era o ponto focal entre infra e o time de desenvolvimento — precisava diagnosticar problema de rede, latência e timeout em produção rápido, sem depender de “acho que é o banco” ou “acho que é a rede”.
Solução: cada camada com sua ferramenta certa, tudo correlacionável.
Camadas#
- Zabbix — saúde da infraestrutura (servidores, rede)
- Grafana + Telegraf — dashboards em tempo real de aplicação
- Loki — centralização de logs
- Percona PMM — análise profunda de banco de dados (queries lentas, locks, índices)
Onde isso importou de verdade#
- Migração do MongoDB Atlas para solução autogerenciada em EC2 — decisão baseada em dados reais de custo e performance coletados pelo PMM, não achismo
- Ambiente escalável na AWS (ALB, Auto Scaling Groups, RDS, ElastiCache) — desenhado e operado com visibilidade completa do que cada componente consumia
- Segurança e confiabilidade — VPC/IAM, backups e revisão de incidentes apoiados pelos mesmos dashboards
Resultado#
- Diagnóstico de problema de rede/latência deixou de ser “abrir 4 ferramentas diferentes” pra ser um fluxo único
- Migração de banco decidida com dado, não com medo
- Colaboração contínua com o time de Dev/Ops em vez de infra isolada apagando incêndio
Tecnologias#
Zabbix · Grafana · Telegraf · Loki · Percona PMM · AWS (ALB, ASG, RDS, ElastiCache) · MongoDB