Vou ajustar fino de LLMs de código aberto com LoRA full tuning e RL


Level 1
Sobre este Serviço
Tradução automática
Posso te ajudar a criar e implementar fluxos de trabalho avançados de treinamento e ajuste fino de LLMs para assistentes específicos de domínio, modelos de raciocínio, chatbots, modelos de instruções e sistemas de linguagem otimizados para tarefas.
Coleta de dados e preparação de datasets
* Coleta de dados na web e baseada em documentos
* Criação de datasets de instruções
* Geração de pares de prompt-resposta
* Curadoria de conversas e datasets de domínio
* Limpeza, deduplicação, filtragem e formatação de dados
* Preparação de dados de preferência para modelagem de recompensa ou RL
Fine-tuning supervisionado (SFT)
* Fine-tuning LoRA / QLoRA
* Fine-tuning de congelamento
* Fine-tuning completo
* Ajuste de instruções
* Ajuste de modelos de chat
* Adaptação de domínio para finanças, cripto, jurídico, suporte, técnico e datasets privados
Métodos de Reinforcement Learning
* Design de pipeline estilo RLHF
* Modelagem de recompensa
* Otimização de preferência
* Fluxos de trabalho de treinamento DPO / ORPO / PPO
* Ajuste de alinhamento para qualidade da resposta, formato e comportamento da tarefa
Configuração de framework de treinamento
* Hugging Face Transformers
* TRL
* PEFT
* DeepSpeed
* Accelerate
* PyTorch
* bitsandbytes
* Integração de inferência vLLM
* Configuração de treinamento multi-GPU e distribuído
Conheça mais sobre Djordje S
Level 1
- A partir deSérvia
- Membro desdejul. de 2024
- Responde em aprox.:1 hora
- Última entrega3 semanas
Idiomas
Sérvio, Inglês
Tradução automática
