Nossa agência irá implantar IA auto-hospedada com open webui e rag


Agência
Sobre este Serviço
Tradução automática
Precisa de um assistente de IA que rode na sua própria infraestrutura, com seus próprios documentos?
A WZ-IT implanta stacks de LLM e RAG auto-hospedados para empresas que não podem enviar dados internos para uma API dos EUA. Open WebUI como interface, LiteLLM como gateway, Qdrant ou pgvector para recuperação, Langfuse para rastreamento e controle de custos.
Dependendo do escopo, cobrimos:
- Open WebUI com SSO, grupos de usuários e acesso a modelos por equipe
- Gateway LiteLLM: uma API para modelos locais e externos, orçamentos por equipe
- inferência vLLM ou Ollama, dimensionada para seu orçamento de GPU ou CPU
- pipeline RAG: ingestão, chunking, embeddings, Qdrant ou pgvector
- recuperação com controle de permissões para que os usuários vejam apenas os documentos que podem
- Langfuse para rastreamento, avaliação e custos por equipe
- implantação no seu servidor GPU, nuvem europeia ou local
A parte mais difícil não é a janela de chat. É fazer a recuperação respeitar as permissões que você já tem e saber o custo mensal real.
Comece com a consulta: uma hora com os fundadores da WZ-IT, além de uma recomendação escrita que você mantém de qualquer forma. Tudo que for maior é cotado como uma oferta personalizada, de acordo com o que você realmente precisa.
Mais do nosso trabalho: wz-it.com
Sobre esta agência

Agência
3 de funcionários
- A partir deAlemanha
- Membro desdeout. de 2019
- Responde em aprox.:1 hora
- Última entrega1 ano
Idiomas
Alemão, Inglês, Holandês
Tradução automática
Portfólio
Perguntas frequentes
Tradução automática
Qual modelo devemos usar?
Depende da tarefa, idioma e hardware. Modelos pequenos de peso aberto atendem à maioria dos assistentes internos; um modelo de 70B precisa de um orçamento sério de GPU. Dimensionamos de acordo com seu caso de uso.
O RAG respeita nossas permissões existentes?
Somente se for construído assim. O filtro precisa acontecer antes da busca por vetor, não pedindo ao modelo que se comporte assim. Essa é a essência do pacote RAG Platform.
Precisamos de uma GPU?
Nem sempre. Modelos pequenos e inferência por CPU são viáveis com baixa concorrência. Te dizemos em qual caso você está antes de comprar hardware.
Você pode conectar ao Nextcloud ou a um compartilhamento de arquivos?
Sim, como fonte de documentos no pipeline de ingestão, incluindo mapeamento de permissões.
4 avaliações deste Serviço
| (4) | ||
| (0) | ||
| (0) | ||
| (0) | ||
| (0) |
Classificação detalhada
- Nível de comunicação do freelancer
- Recomendar a um amigo
- Serviço conforme a descrição
Ordenar por
P pawelpavlo

Alemanha
Very well and quickly executed order :) I recommend !!!
Útil?D dnlnrx
Cliente recorrente

Alemanha
Exzellente Arbeit. 1A Kommunikation.
Útil?S sbroderman

Suécia
Perfect delivery!
Útil?S 
sangeorgean2
Cliente recorrente

Alemanha
Super, thank you!
Útil?
4 avaliações deste Serviço
| (4) | ||
| (0) | ||
| (0) | ||
| (0) | ||
| (0) |
Classificação detalhada
- Nível de comunicação do freelancer
- Recomendar a um amigo
- Serviço conforme a descrição
Ordenar por
P pawelpavlo

Alemanha
Very well and quickly executed order :) I recommend !!!
Útil?D dnlnrx
Cliente recorrente

Alemanha
Exzellente Arbeit. 1A Kommunikation.
Útil?S sbroderman

Suécia
Perfect delivery!
Útil?S 
sangeorgean2
Cliente recorrente

Alemanha
Super, thank you!
Útil?
