Vou implantar e gerenciar infraestrutura de mlops, llm e gpu na aws e kubernetes
Engenheiro sênior de DevOps de IA: AWS, Kubernetes, APIs do ComfyUI, DevSecOps
Sobre este Serviço
Coloco modelos de IA em produção e os mantenho funcionando. Um script de treinamento não é um produto. Um serviço monitorado, versionado e com autoescalonamento é.
Ferramentas:
Kubernetes
•
Docker
•
Amazon EKS
Frameworks:
Terraform
•
Ansible
Linguagem de programação:
Bash
•
Vá
•
Python
Especialidade:
Instalação
•
Migração
•
Depuração
Outros serviços de Engenharia de DevOps que eu ofereço
Perguntas frequentes
Tradução automática
Quais modelos você pode implantar?
Qualquer modelo aberto no Hugging Face, além de Llama, Mistral, Qwen, DeepSeek e seus próprios ajustes finos. Para imagem e vídeo, também trabalho com Flux, SDXL e Wan. Me diga o modelo e confirmarei a GPU necessária.
Preciso ter minha própria conta na nuvem?
Sim, e isso é intencional. Tudo roda na sua conta da AWS, GCP ou RunPod, assim você possui a infraestrutura e controla a cobrança. Eu configuro e entrego para você.
Quanto vai custar por mês para rodar?
Depende do tamanho do modelo e do tráfego. Antes de você fazer o pedido, dou uma estimativa de dimensionamento: tipo de GPU, utilização esperada e faixa de custo mensal. Instâncias spot e escala para zero geralmente reduzem bastante.
Você fornece o código fonte do Terraform e Helm?
Sempre. Você recebe o repositório completo, Dockerfiles, charts do Terraform ou Helm e documentação da API, para que você ou outro engenheiro possam manter depois.
Você consegue consertar uma configuração já existente ao invés de montar uma nova?
Sim. Problemas na implantação, crashes por OOM, nós de GPU que não agendam, contas de nuvem descontroladas e infraestrutura sem documentação fazem parte do que eu faço.
Você faz LLMs self-hosted no local?
Sim. Ollama ou vLLM com Open WebUI no seu próprio servidor ou estação de trabalho GPU, totalmente offline, sem dados saindo da sua rede.
Que monitoramento eu recebo?
Prometheus e Grafana com dashboards de latência, throughput, utilização de GPU, taxa de erro e custo por requisição, além de alertas que te avisam antes que seus usuários percebam.
Qual é o seu horário de trabalho?
Estou disponível 24/7 e trabalho no horário dos EUA, então podemos conversar no seu fuso horário. Geralmente respondo em até uma hora.
