Como engenheiro de Machine Learning especializado em NLP e IA simbólica, ofereço avaliação completa, benchmarking e red-teaming para seus Large Language Models (LLMs) e pipelines RAG. Ajudo equipes de engenharia a identificar falhas em casos extremos, eliminar alucinações e reforçar as medidas de segurança.
O que eu ofereço:
- Benchmarking de LLM e auditoria de desempenho: Avaliação da precisão do modelo, latência, uso de contexto e capacidades de raciocínio com base em critérios de teste personalizados.
- Detecção de alucinações e casos extremos: Testes de estresse em prompts do sistema, precisão na recuperação RAG e consistência factual sob condições adversas.
- Red Teaming e testes de segurança: Identificação de vulnerabilidades como ataques de prompt injection, jailbreaks e vazamentos de prompts do sistema.
- Validação de esquema e saída: Verificação de conformidade rigorosa com estrutura JSON/Pydantic, execução de chamadas de função e confiabilidade na integração de API.
- Relatório de auditoria detalhado e plano de ação: Análise completa de falhas com correções acionáveis de engenharia de prompt e recomendações de guardrails.