Deepgram vs Whisper para agentes de voz IA: escolha honesta
Qual STT usar no seu agente de voz IA? Comparamos Deepgram Nova-3 e Whisper em latência, precisão, custo e streaming para bots em tempo real.
A pergunta não é qual é mais preciso
Se o seu agente de voz demora três segundos para responder depois que o usuário para de falar, não importa que o motor de reconhecimento de fala tenha acertado cada palavra. O usuário já desistiu e digitou. Então a pergunta honesta ao escolher entre Deepgram e Whisper para um agente de voz IA não é "qual tem a menor taxa de erro por palavra" - os dois estão perto o suficiente em áudio limpo para um chatbot. É "qual me deixa responder dentro da janela em que uma pessoa ainda se sente ouvida".
Essa janela é de aproximadamente 800 milissegundos de ponta a ponta, do momento em que o usuário para de falar até o bot começar a responder, e o STT costuma ser o primeiro lugar onde ela se perde. Este post é o resumo honesto: o que cada motor realmente faz, quanto custam quando você os roda em um bot de voz real no Telegram ou WhatsApp, e a única regra que decide entre eles sem que você precise rodar um benchmark próprio.
O que você está escolhendo de fato
Deepgram é uma API hospedada. Você envia áudio para os servidores deles, eles devolvem transcrições. O Nova-3 é o modelo top atual e o Flux é a variante mais nova, ajustada especificamente para agentes de voz, com detecção de fim de turno embutida, então o bot sabe quando o usuário parou de falar sem que você escreva essa lógica. A Deepgram publica latência P50 de streaming na faixa de 200 a 300 milissegundos em produção, que é o número que importa em tempo real.
Whisper é um modelo com pesos abertos da OpenAI. Você pode usar a API hospedada da OpenAI ou rodar uma das reimplementações da comunidade (faster-whisper, whisper.cpp) no seu próprio hardware. O modelo de referência Whisper Large v3 tem cerca de 1,55 bilhão de parâmetros e marca em torno de 10 por cento de taxa de erro por palavra nos benchmarks limpos padrão. É um modelo pensado para lotes - você entrega um pedaço de áudio, ele devolve a transcrição, e não existe um caminho real de streaming na implementação de referência.
Essa é toda a diferença em uma frase: Deepgram foi feito para responder enquanto você ainda está falando, e Whisper foi feito para responder com precisão depois que você terminou. Todo o resto desta comparação é consequência disso.
Precisão: mais igual do que os benchmarks sugerem
No papel, Deepgram Nova-3 marca entre 5,26 e 6,84 por cento de erro por palavra em produção, contra os 10 por cento aproximados do Whisper Large v3. É uma diferença real e se mantém nas comparações que a própria Deepgram publica. Mas um benchmark independente publicado em julho de 2026, com 14 modelos de STT e 904 arquivos de áudio, encontrou o Nova-3 em inglês com média de 12,3 por cento de WER, essencialmente empatado com o Whisper-1 em 11,9 por cento, e o AssemblyAI Universal-3.5 à frente dos dois em 7,0 por cento.
A diferença entre "número publicado pela Deepgram" e "número de benchmark independente" não é desonestidade. É que a taxa de erro por palavra é enormemente sensível ao áudio que você joga nela: sotaque, ruído, vocabulário específico, taxa de amostragem, codec. O Nova-3 ganha em áudio limpo de reuniões em inglês e perde em outros idiomas, e o faster-whisper Large v3 auto-hospedado já registrou 4,2 por cento de WER em um cara a cara contra o Deepgram Nova-2 em 6,7 por cento.
A conclusão honesta: no tipo de áudio que o seu bot de voz vai ver de verdade - alguém falando no microfone de um celular, em um dos idiomas que você suporta, com ruído de ambiente - os dois motores estão dentro da faixa de precisão onde a transcrição serve. Se precisão for o seu diferencial, rode um benchmark pequeno nas suas próprias gravações. Para a maioria dos agentes não é o diferencial. Latência é.
Latência: o fator que realmente decide
A API de streaming da Deepgram devolve transcrições parciais enquanto o usuário ainda está falando. A latência de ponta a ponta fica em torno de 200 a 300 milissegundos em produção. A variante Flux é ajustada especificamente para agentes de voz, com detecção de fim de turno integrada ao modelo, para que o pipeline saiba quando o usuário terminou sem que você parafuse um detector de atividade de voz separado.
O Whisper via API da OpenAI é em lote. Você envia o arquivo, recebe a resposta, e o "quanto isso demorou" depende do tamanho do arquivo mais o ida e volta de rede. Serve para uma mensagem de voz em que o usuário não espera resposta ao vivo. Não serve para uma conversa.
faster-whisper auto-hospedado em GPU é bem mais rápido que a API hospedada, mas ainda é em lote por design. Os wrappers da comunidade simulam streaming empurrando blocos de áudio de tamanho fixo pelo modelo e costurando as saídas, o que costuma adicionar de dois a cinco segundos de latência por bloco e produz aquela sensação clássica de "aguarde um momento". Se você precisa auto-hospedar e quer tempo real, está olhando para uma arquitetura diferente (detecção de atividade de voz própria, aquecimento do modelo, sobreposição de blocos) que é um projeto à parte.
Então: se a resposta acontece depois que o usuário termina de falar, qualquer um dos dois motores dá conta. Se a resposta precisa parecer uma interrupção humana, Deepgram é o padrão.
Custo: os números que realmente pesam
Deepgram Nova-3 lista a 0,0043 dólares por minuto para áudio pré-gravado e entre 0,0058 e 0,0077 por minuto em streaming, faturado por segundo. A API Whisper Large v3 da OpenAI custa 0,006 por minuto, e o gpt-4o-mini-transcribe custa 0,003 por minuto. A variante em tempo real gpt-realtime-whisper custa 0,017 por minuto.
Auto-hospedar faster-whisper em uma GPU dedicada derruba o custo marginal para cerca de 0,0003 dólares por minuto na faixa de 1.000 horas por mês - cerca de 14 vezes mais barato que Deepgram em escala - mas esse número assume que a GPU está a plena carga. Em volume baixo, o custo é dominado pelo aluguel fixo por hora da GPU e auto-hospedar sai mais caro, não mais barato.
O ponto de cruzamento para um bot típico de fundador solo fica em torno de 100 horas de áudio por mês. Abaixo disso, as APIs hospedadas vencem no custo total incluindo o seu tempo. Acima, auto-hospedar começa a valer a pena. Quase nenhum bot de voz pessoal ou de time pequeno está acima dessa linha.
A regra que decide
Aqui vai a única regra que te poupa de rodar um benchmark:
- Conversa em tempo real como o objetivo (respostas de voz esperadas em menos de um segundo, turnos naturais, ligações): Deepgram. Use Flux se quiser a detecção de fim de turno pronta, Nova-3 se quiser o STT cru.
- O usuário grava, o bot responde depois (memos de voz do Telegram, notas de áudio do WhatsApp, transcrição de clipes mais longos): Whisper via API da OpenAI. Mais barato, mais preciso em formato longo, sem desvantagem real de latência.
- Você tem volume sério e quer ser dono do stack (mais de 100 horas de áudio por dia, os dados precisam ficar no seu próprio hardware):
faster-whisperauto-hospedado em GPU. Reserve uma pessoa para manter o wrapper.
Para um bot típico de Telegram em que o usuário manda um memo de voz e espera resposta em alguns segundos, Whisper é a escolha certa e Deepgram é exagero. Para um agente nativo de telefone que precisa sustentar uma conversa, é ali que Deepgram justifica o preço.
Onde o Hermes Agent entra
Se você está rodando o Hermes Agent no Telegram ou WhatsApp, quase certamente quer a rota Whisper. Memos de voz são a forma comum, o usuário está acostumado a uma resposta de dois ou três segundos, e a API hospedada do OpenAI Whisper encaixa sem infraestrutura. O guia do modo voz do Hermes Agent mostra como o slot de STT é ligado no gateway.
Se você está usando o Hermes para atender chamadas de voz ao vivo ou um canal em que a resposta precisa parecer interruptiva, Deepgram Nova-3 ou Flux é a escolha honesta, e os poucos centavos extras por hora te compram uma conversa que não soa como walkie-talkie. Do lado do TTS do pipeline, nosso panorama de provedores TTS tem as escolhas honestas para a metade de resposta da conversa.
Se preferir não gerenciar nada disso na mão, comece com a Hermify - o Hermes Agent gerenciado no Telegram te entrega memória persistente, respostas de voz e um bot no ar em cerca de um minuto. O STT e o TTS já estão conectados, e você troca de provedor quando o padrão de uso mudar sem tocar em infraestrutura.
Resumo
Deepgram ganha em tempo real. Whisper ganha em lote e em custo. A diferença de taxa de erro por palavra é real, mas não é o que decide entre eles - a arquitetura de streaming decide. Escolha Deepgram quando o usuário espera resposta enquanto ainda está falando; escolha Whisper quando o usuário aceita esperar os dois segundos que um memo de voz naturalmente leva; escolha faster-whisper auto-hospedado só quando o seu volume e as suas necessidades de privacidade justificarem ser dono do stack.
Se você está construindo um bot de voz e não sabe de que lado da linha está, comece com Whisper. É mais barato, mais fácil e, se você superar, Deepgram é uma troca de uma linha. No sentido contrário é reescrita.
Sources
Lance seu próprio agente Hermes
Traga sua chave de API, conecte o Telegram e tenha um agente de IA que evolui sozinho no ar em 60 segundos.
Começar agora