Vou construir uma API de transcrição whisper para seu produto


Sobre este Serviço
Tradução automática
Eu criei um pipeline de voz em streaming de ponta a ponta: fala para texto com Whisper, texto para fala com ElevenLabs, rodando na AWS Bedrock com memória de conversa.
A maioria dos gigs de transcrição envolvem apenas envolver a API e parar por aí. As partes difíceis vêm depois: arquivos longos que expiram, latência que você consegue ouvir numa chamada ao vivo, separação de falantes e uma conta que cresce mais rápido que seu uso.
O que você recebe:
- Transcrição com Whisper, com timestamps e detecção de idioma
- Streaming, para que o texto chegue enquanto o áudio ainda está tocando
- Filas e tentativas para arquivos longos ou que falharam
- Registro de custos por minuto de áudio
Minha formação é em telecomunicações. Tenho mestrado em Redes de Informação pela Odessa National Academy of Telecommunications, sou CCNA e trabalhei numa plataforma industrial de VoIP 5G na Siemens, com criptografia de ponta a ponta, numa equipe de 45 a 50 pessoas.
Trabalho da Ucrânia no horário CET.
Me diga seu volume de áudio e sua meta de latência, e eu te direi o que é realista antes de você fazer o pedido.
Conheça mais sobre Michael S.
CTO and AI Developer, 18 Years: LangChain, RAG, Voice AI, Python Backends
- A partir deUcrânia
- Membro desdefev. de 2023
- Responde em aprox.:1 hora
Idiomas
Russo, Ucraniano, Inglês, Alemão
Tradução automática
Meu portfólio
Perguntas frequentes
Tradução automática
Qual motor de fala para texto você usa?
Por padrão, Whisper, pois lida bem com sotaques e ruídos de fundo. Também trabalho com alternativas como Deepgram ou AssemblyAI, se seu projeto já roda em um deles ou precisa de uma funcionalidade que eles oferecem melhor.
Você suporta transcrição em tempo real ou streaming?
Sim, a partir do pacote Padrão. O texto chega enquanto o áudio ainda está tocando, ao invés de você esperar o arquivo inteiro terminar para ver alguma coisa.
Quais idiomas são suportados?
O Whisper suporta dezenas de idiomas de fábrica, incluindo detecção automática de idioma. Envie seus idiomas alvo e eu confirmarei a cobertura e destacarei possíveis trade-offs de precisão antes de você fazer o pedido.
Você pode adicionar texto para fala, para meu app falar de volta?
Sim, no pacote Premium. Eu combino a transcrição com ElevenLabs para uma saída de voz natural, assim você tem um pipeline completo de fala-in, fala-out, não só transcrição.
Como você lida com arquivos de áudio longos ou que falharam?
Arquivos longos entram numa fila com tentativas de retries a partir do pacote Padrão, para que um job lento ou que falhou não bloqueie seus uploads ou faça expirar a requisição.
Isso pode rodar no meu próprio servidor ou conta na nuvem?
Sim. No pacote Premium, eu implanto o pipeline na sua própria AWS ou Azure, assim o áudio e a infraestrutura permanecem sob seu controle.
Como o custo é calculado e posso mantê-lo sob controle?
Eu registro o custo por minuto de áudio processado em cada pacote, assim você vê exatamente quanto cada requisição custa, ao invés de se surpreender com a conta mensal.
