Vou configurar observabilidade e alertas

Algumas informações foram traduzidas automaticamente.

Índia

Eu falo Inglês, Hindi

Especialista em SRE e DevOps em Kubernetes, Terraform e Cloud

Sou um Staff Site Reliability Engineer com mais de 12 anos de experiência prática em DevOps, infraestrutura em nuvem, Kubernetes, Terraform, CI/CD, observabilidade, automação e confiabilidade em produ...
Sobre este Serviço

Precisa de visibilidade confiável dos seus sistemas, não apenas mais um painel? Eu vou configurar, melhorar ou solucionar problemas de uma solução de observabilidade limitada para uma aplicação, serviço, workload, namespace ou pipeline de telemetria acordados.

Um cluster completo de Kubernetes é incluído somente quando seu tamanho, workloads, fontes de telemetria e integrações necessárias se encaixam no pacote selecionado e são acordados antes do pedido.


Dependendo do pacote e do escopo acordado, posso ajudar com:

  • Coleta de métricas, logs e traces
  • Configuração de OpenTelemetry, OTLP e Grafana Alloy
  • Integração de Grafana, Prometheus, Loki e Alertmanager
  • Dashboards e alertas acionáveis
  • Definição de SLI e SLO
  • Resolução de problemas de telemetria ausente, alertas barulhentos e pipeline
  • Validação, documentação e entrega

Sou um Staff Site Reliability Engineer com mais de 12 anos de experiência em DevOps e SRE. Meu trabalho inclui observabilidade em produção, instrumentação de aplicações, pipelines de telemetria, resposta a incidentes e revisões de confiabilidade.

Cada pacote possui limites definidos para ambientes, fontes de telemetria, dashboards, alertas e SLOs. Plataformas multi-ambiente, multi-cluster, críticas para produção ou grandes plataformas existentes requerem discussão antes do pedido.

Ferramentas:

Docker

GitLab

Jenkins

GitHub

BitBucket

Kubernetes

Frameworks:

Terraform

Ansible

Provedor de Nuvem:

Amazon Web Services

microsoft azure

Linguagem de programação:

Bash

Python

Especialidade:

Instalação

Desenvolvimento

Configuração