Eu vou configurar, validar e solucionar problemas do seu cluster de GPU e infraestrutura de IA
Engenheiro sênior de infraestrutura HPC e IA, GPU SLURM Linux
Sobre este Serviço
Você tem GPUs. Precisa que elas funcionem como uma plataforma de computação confiável.
Eu construo e gerencio infraestrutura de GPU e HPC em produção: provisionamento, validação de drivers e pilha CUDA, agendamento, rede de alta velocidade e monitoramento. Trabalho na camada de infraestrutura. Não sou engenheiro de ML e não vou fingir ser um.
O QUE EU FAÇO
Configuração do nó GPU: alinhamento de driver NVIDIA, toolkit e runtime CUDA, modo de persistência, MIG
Validação de saúde: diagnósticos DCGM, triagem de erros Xid e ECC, verificações térmicas e de energia
Comunicação entre múltiplos nós GPU: testes nccl, benchmarking all-reduce, ajuste de NCCL, validação do caminho de rede
Agendamento: partições GPU SLURM e GRES, cgroups e binding, ou Kubernetes com o plugin de dispositivo NVIDIA e GPU Operator
Monitoramento: Prometheus, DCGM exporter, dashboards Grafana
Automação: funções Ansible para tornar o build repetível
ANTES DE PEDIR
Me envie uma mensagem com a quantidade de nós, modelo de GPU, interconexão e o que você está vendo. Se não for algo que eu possa realmente resolver, vou dizer.
Você recebe configuração funcional, resultados de benchmark mostrando o que foi alterado e documentação escrita.
Servidor:
Servidor de banco de dados
Sistema operacional:
Linux
Outros serviços de Suporte de TI que eu ofereço
Perguntas frequentes
Tradução automática
Você escreve kernels CUDA ou treina modelos?
Não. Trabalho na infraestrutura subjacente: provisionamento, drivers, agendamento, rede e monitoramento. Código de modelos e scripts de treinamento estão fora do meu escopo, e prefiro dizer isso do que assumir trabalhos que não posso fazer bem.
Que acesso você precisa para começar?
Acesso SSH com sudo nos nós e acesso ao BMC ou IPMI se forem necessárias verificações a nível de hardware. Para o diagnóstico básico, acesso somente leitura geralmente é suficiente para começar.
Você trabalha com GPUs na nuvem ou apenas localmente?
Ambos. Clusters bare-metal no local e instâncias de GPU na AWS.
Nossas GPUs estão quase não utilizadas. Você consegue descobrir por quê?
Normalmente sim. Baixa utilização costuma estar relacionada a agendamento, carregamento de dados, NUMA e afinidade, ou à interconexão. O diagnóstico básico foi feito exatamente para essa questão, e você recebe as medições que explicam a resposta.
Você suporta redes InfiniBand?
Minha experiência com redes de alta velocidade é Ethernet e RoCE, não InfiniBand. Se sua rede for InfiniBand, te aviso antes de você pedir, ao invés de aprender na sua infraestrutura.
2 avaliações deste Serviço
| (2) | ||
| (0) | ||
| (0) | ||
| (0) | ||
| (0) |
Classificação detalhada
- Nível de comunicação do freelancer
- Qualidade da entrega
- Valor da entrega
Ordenar por
A apreda1

Estados Unidos
I hired him again he assisted me with my project very effectively. I definitely recommend him
US$ 50-US$ 100
Preço
1 dia
Tempo
Útil?A aimen39

Argélia
Best seller + communication + skills + knowledge
US$ 50-US$ 100
Preço
1 dia
Tempo
H 
Resposta do freelancer
Útil?
2 avaliações deste Serviço
| (2) | ||
| (0) | ||
| (0) | ||
| (0) | ||
| (0) |
Classificação detalhada
- Nível de comunicação do freelancer
- Qualidade da entrega
- Valor da entrega
Ordenar por
A apreda1

Estados Unidos
I hired him again he assisted me with my project very effectively. I definitely recommend him
US$ 50-US$ 100
Preço
1 dia
Tempo
Útil?A aimen39

Argélia
Best seller + communication + skills + knowledge
US$ 50-US$ 100
Preço
1 dia
Tempo
H 
Resposta do freelancer
Útil?
