Eu vou quantizar seu modelo de IA


Sobre este Serviço
Tradução automática
Se suas contas de GPU na nuvem estão ficando altas demais, ou se seu modelo ajustado está pesado demais para rodar em hardware de borda?
Sou engenheiro de sistemas de aprendizado de máquina especializado em quantização de baixo bit, otimização de inferência e implantação em borda. Trabalho com modelos de linguagem grande, visão e mistura de especialistas (MoE) e reduzo seu uso de memória em 50% a 80% sem perder precisão.
Se você precisa de um modelo de 70B comprimido para GPUs de consumo, um de 7B rodando em um Mac/iPhone com Apple Silicon, ou um arquivo GGUF calibrado para conformidade corporativa local, vou montar o pipeline de runtime exato que você precisa.
Em que eu me especializo:
* Formatos & Runtimes: GGUF (llama.cpp), MLX (Apple Silicon Mac/iOS), EXL2, AWQ, GPTQ, bitsandbytes (NF4/FP8).
* Arquiteturas de modelos: Llama 3, Qwen 2.5 / 3.8, Mistral, Gemma, modelos MoE (OLMoE, Mixtral), e Modelos de Visão-Linguagem (VLMs).
* Hardware alvo: GPUs NVIDIA únicas (L4, A10, RTX 4090), Apple Silicon (memória unificada da série M, iOS), e inferência em CPU.
* Precisão & Qualidade: Calibração avançada (imatrix), quantização consciente de ativação e verificação de qualidade determinística (Perplexidade & avaliações downstream).
Conheça mais sobre Kaleb C
Senior Data AI Leader
- A partir deEstados Unidos
- Membro desdemai. de 2024
Idiomas
Inglês
Tradução automática

