Vou configurar monitoramento e alertas do prometheus grafana para seus servidores
AWS DevOps e SRE, 7 anos, Kubernetes CKA, Terraform, CICD
Sobre este Serviço
Descobrir que seu servidor caiu por causa de um cliente não é a melhor forma de saber. Deixe que eu configure um monitoramento que te avise primeiro.
Senior DevOps / SRE, com mais de 7 anos na Zoom, Airtel, Infosys e Mindtree. Eu fico de plantão para mais de 150 hosts Linux e multi-cluster EKS com uptime acima de 99%, usando Prometheus, Grafana, Datadog e PagerDuty todos os dias. Certificado: CKA, AWS Solutions Architect, AWS SysOps, Terraform.
O QUE EU CONFIGURO
Prometheus com node exporter, cAdvisor e exporters de serviço
Dashboards no Grafana que mostram o que realmente importa, não 40 painéis inúteis
Regras do Alertmanager enviadas para Slack, email ou PagerDuty
Loki para logs centralizados, pesquisáveis ao lado das suas métricas
Monitoramento de Kubernetes: pods, nós, deployments, pressão de recursos
Alarmes do AWS CloudWatch onde eles se encaixam melhor do que Prometheus
POR QUE ISSO IMPORTA
Alertas que disparam o tempo todo acabam sendo ignorados. Eu ajusto os limites para que cada alerta signifique que algo realmente está errado e precisa de uma intervenção humana.
COMO EU FUNCIONO
Passo um: me conte o que você roda e o que já te prejudicou antes.
Passo dois: confirmo o escopo e o que deve disparar alerta. A consultoria é gratuita.
Passo três: stack funcionando, alertas ajustados e um runbook para cada alerta.
Me envie uma mensagem com sua configuração para uma consultoria gratuita.
Ferramentas:
Docker
•
Kubernetes
•
Amazon EKS
•
Outros
Frameworks:
Terraform
•
Ansible
Provedor de Nuvem:
Amazon Web Services
Linguagem de programação:
Bash
•
Python
Especialidade:
Instalação
•
Depuração
•
Configuração

