Eu vou construir uma pipeline de rag de produção sobre seu conhecimento de negócios


Sobre este Serviço
Tradução automática
As demos de RAG são fáceis. RAG que aguenta perguntas reais não é.
Eu construo pipelines de recuperação que funcionam quando um usuário real faz uma pergunta difícil: recuperação híbrida (vetor mais palavra-chave), uma etapa de reranking, chunking feito com base na forma do seu documento ao invés de uma contagem fixa de tokens, e um conjunto de avaliação para você provar a precisão ao invés de só esperar por ela.
O que você recebe:
- Ingestão das suas fontes reais: PDFs, documentos, planilhas, sites, tabelas de banco de dados, tickets de suporte
- Limpeza e uma representação canônica do documento, o passo que a maioria dos pipelines pula
- Recuperação híbrida mais reranking com cross-encoder, ajustado com base nas suas próprias perguntas
- Um conjunto de perguntas de ouro com resultados classificados, para que uma regressão seja visível antes que seus usuários a encontrem
- Geração fundamentada com citações de volta ao trecho fonte
- Implantado como uma API que você possui, ou direto na sua aplicação existente
Eu executo isso em um sistema de produção multi-inquilino, incluindo as partes menos glamourosas: reindexação quando o conteúdo muda, custo por consulta, limites de latência e rotas de failover.
Conte-me quais são seus documentos e o que as pessoas precisam perguntar a eles.
Conheça mais sobre Ehsan
AI Agent and RAG Engineer
- A partir deÍndia
- Membro desdejun. de 2024
- Responde em aprox.:1 hora
Idiomas
Inglês
Tradução automática
Perguntas frequentes
Tradução automática
Qual banco de dados vetorial você usa?
Postgres com pgvector por padrão: barato e uma sistema a menos para rodar. Pinecone, Qdrant ou Weaviate se você já usa ou prefere eles.
Em qual LLM ele vai rodar?
No seu ou no meu. OpenAI, Anthropic, Gemini, ou modelos de peso aberto que você hospeda. Auto-hospedagem realmente fica mais barato após um certo volume e vou te dizer honestamente onde essa linha fica para seu uso.
Ele pode rodar totalmente na nossa infraestrutura?
Sim, incluindo modelos auto-hospedados, sem que o conteúdo dos documentos saia do seu ambiente. Me diga suas restrições de residência de dados desde o começo e eu ajustarei o escopo.
Como posso ter certeza de que a recuperação é realmente precisa?
Você recebe um conjunto de perguntas de ouro com resultados de recuperação classificados nos seus próprios dados. A precisão é reportada com números, não só afirmada. Nos planos Standard e Premium você também recebe scores antes e depois.
Você consegue trabalhar com documentos digitalizados ou imagens?
Sim, com OCR. Me avise ao me enviar mensagem para que eu ajuste o escopo corretamente, pois fontes digitalizadas mudam bastante o trabalho de ingestão.

