Eu vou quantizar seu modelo de IA

K
kalebcadenhead
K
kalebcadenhead
Kaleb C
Algumas informações foram traduzidas automaticamente.

Sobre este Serviço

Tradução automática

Se suas contas de GPU na nuvem estão ficando altas demais, ou se seu modelo ajustado está pesado demais para rodar em hardware de borda?


Sou engenheiro de sistemas de aprendizado de máquina especializado em quantização de baixo bit, otimização de inferência e implantação em borda. Trabalho com modelos de linguagem grande, visão e mistura de especialistas (MoE) e reduzo seu uso de memória em 50% a 80% sem perder precisão.


Se você precisa de um modelo de 70B comprimido para GPUs de consumo, um de 7B rodando em um Mac/iPhone com Apple Silicon, ou um arquivo GGUF calibrado para conformidade corporativa local, vou montar o pipeline de runtime exato que você precisa.


Em que eu me especializo:

* Formatos & Runtimes: GGUF (llama.cpp), MLX (Apple Silicon Mac/iOS), EXL2, AWQ, GPTQ, bitsandbytes (NF4/FP8).

* Arquiteturas de modelos: Llama 3, Qwen 2.5 / 3.8, Mistral, Gemma, modelos MoE (OLMoE, Mixtral), e Modelos de Visão-Linguagem (VLMs).

* Hardware alvo: GPUs NVIDIA únicas (L4, A10, RTX 4090), Apple Silicon (memória unificada da série M, iOS), e inferência em CPU.

* Precisão & Qualidade: Calibração avançada (imatrix), quantização consciente de ativação e verificação de qualidade determinística (Perplexidade & avaliações downstream).


Conheça mais sobre Kaleb C

Kaleb C

Senior Data AI Leader

  • A partir deEstados Unidos
  • Membro desdemai. de 2024
  • Idiomas

    Inglês
I am a Senior Manager of Data & AI and Founding IT Leader with experience building data and IT functions from the ground up. I specialize in architecting scalable infrastructure, Snowflake data warehouses, and production AI agents that drive operational leverage. I thrive at the intersection of data engineering and applied AI to deliver reliable, HIPAA-compliant systems.

Tradução automática

Outros serviços de Desenvolvimento de IA que eu ofereço