Vou construir um agente de IA de voz usando elevenlabs, stt e llm em python


Sobre este Serviço
Tradução automática
Implante um agente inteligente de IA de voz que possa ouvir, raciocinar e falar em tempo real.
Eu crio arquiteturas personalizadas de IA de voz conversacional em Python, combinando streaming de áudio de baixa latência com LLMs e síntese de fala.
O que entrego:
- Pipelines de voz de ponta a ponta: Detecção de Atividade de Voz (VAD) + Whisper (STT) + raciocínio com LLM + ElevenLabs (TTS)
- Roteamento de áudio de ultra baixa latência via pipes assíncronos do Linux
- Integração com chamadas de voz no Telegram via Pyrogram
- Implantação na nuvem com GPU (workers do RunPod, processamento paralelo de filas, escalonamento dinâmico)
- Backend modular em Python com captura e síntese de áudio isoladas
Pilha: Python, asyncio, ElevenLabs, Whisper, GPU do RunPod, Pyrogram.
Por favor, entre em contato comigo antes de fazer o pedido para revisar credenciais de API e requisitos de latência de voz.
Conheça mais sobre Moddie
Fullstack web developer
- A partir deUcrânia
- Membro desdeout. de 2024
- Responde em aprox.:1 hora
Idiomas
Ucraniano, Russo, Inglês
Tradução automática
Meu portfólio
Perguntas frequentes
Tradução automática
Como você consegue baixa latência na síntese de fala?
Eu faço streaming de pedaços de áudio via pipes assíncronos do Linux diretamente para o player, sem salvar arquivos temporários de áudio no disco, reduzindo a latência abaixo de 600ms
Esse agente de voz pode fazer chamadas telefônicas ou no Telegram?
Sim, posso integrar o agente com chamadas de voz no Telegram via Pyrogram ou APIs externas de telefonia (Twilio/LiveKit)

