Volver al Blog
VoiceSTTAI AgentsHermes

Deepgram vs Whisper para agentes de voz IA: elección clara

¿Qué STT elegir para tu agente de voz IA? Comparamos Deepgram Nova-3 y Whisper en latencia, precisión, coste y streaming para bots en tiempo real.

Por Hermify Team||8 min de lectura
El logotipo de Deepgram a la izquierda y el de OpenAI Whisper a la derecha, separados por una fina línea vertical verde sobre un fondo oscuro, con el texto Deepgram vs Whisper

La pregunta no es cuál es más preciso

Si tu agente de voz tarda tres segundos en responder después de que el usuario deje de hablar, da igual que tu motor de reconocimiento de voz haya acertado todas las palabras. El usuario ya se ha rendido y ha escrito. Por eso la pregunta honesta al elegir entre Deepgram y Whisper para un agente de voz IA no es "cuál tiene menor tasa de error por palabra" - los dos están lo bastante cerca en audio limpio para un chatbot. Es "cuál me deja responder dentro de la ventana en la que una persona todavía se siente escuchada".

Esa ventana son aproximadamente 800 milisegundos de extremo a extremo, desde que el usuario deja de hablar hasta que tu bot empieza a responder, y el STT suele ser el primer sitio donde se pierde. Este artículo es el desglose honesto: qué hace cada motor de verdad, cuánto cuestan cuando los usas para un bot real de voz en Telegram o WhatsApp, y la única regla que decide entre ellos sin que tengas que ejecutar tu propio benchmark.

Qué eliges en realidad

Deepgram es una API alojada. Tú envías el audio a sus servidores y ellos devuelven la transcripción. Nova-3 es su modelo estrella actual y Flux es la variante más nueva, ajustada específicamente para agentes de voz, con detección de fin de turno integrada, de modo que el bot sabe cuándo el usuario ha terminado de hablar sin que tengas que escribir esa lógica. Deepgram publica una latencia P50 en streaming de entre 200 y 300 milisegundos en producción, que es la cifra que importa para tiempo real.

Whisper es un modelo con pesos abiertos de OpenAI. Puedes usar la API alojada de OpenAI o ejecutar una de las reimplementaciones de la comunidad (faster-whisper, whisper.cpp) en tu propio hardware. El modelo de referencia Whisper Large v3 tiene unos 1.550 millones de parámetros y consigue alrededor del 10 por ciento de tasa de error por palabra en los benchmarks limpios estándar. Es un modelo pensado para lotes - le entregas un trozo de audio, te devuelve la transcripción, y no hay una ruta real de streaming en la implementación de referencia.

Esa es toda la diferencia en una frase: Deepgram está hecho para responder mientras aún estás hablando, y Whisper está hecho para responder con precisión una vez que has terminado. Todo lo demás en esta comparación es una consecuencia de eso.

Precisión: más igualada de lo que sugieren los benchmarks

Sobre el papel, Deepgram Nova-3 marca entre 5,26 y 6,84 por ciento de error por palabra en producción, frente al 10 por ciento aproximado de Whisper Large v3. Es una brecha real y se sostiene en las comparaciones que publica el propio Deepgram. Pero un benchmark independiente publicado en julio de 2026, con 14 modelos de STT y 904 archivos de audio, encontró que Nova-3 en inglés promediaba un 12,3 por ciento de WER, empatado con Whisper-1 al 11,9 por ciento, y con AssemblyAI Universal-3.5 por delante de ambos al 7,0 por ciento.

La brecha entre "cifra publicada por Deepgram" y "cifra de benchmark independiente" no es deshonestidad. Es que la tasa de error por palabra es enormemente sensible al audio que le tires: acento, ruido, vocabulario específico, frecuencia de muestreo, códec. Nova-3 gana en audio limpio de reuniones en inglés y pierde en otros idiomas, y faster-whisper Large v3 autohospedado ha llegado a marcar un 4,2 por ciento de WER en un cara a cara contra Deepgram Nova-2 al 6,7 por ciento.

La conclusión honesta: en el tipo de audio que verá tu bot de verdad - alguien hablando al micro de un móvil, en uno de los idiomas que soportas, con ruido de fondo - los dos motores están dentro del rango de precisión en el que la transcripción sirve. Si la precisión es tu diferenciador, corre un pequeño benchmark con tus propias grabaciones. Para la mayoría de agentes no es el diferenciador. La latencia sí.

Latencia: el factor que de verdad decide

La API de streaming de Deepgram devuelve transcripciones parciales mientras el usuario sigue hablando. La latencia de extremo a extremo se queda en torno a 200-300 milisegundos en producción. Su variante Flux está ajustada específicamente para agentes de voz, con detección de fin de turno integrada en el modelo, para que la tubería sepa cuándo el usuario ha terminado sin que tengas que atornillar un detector de actividad de voz aparte.

Whisper vía la API de OpenAI va por lotes. Envías el archivo, recibes la respuesta, y el "cuánto ha tardado esto" depende de la duración del archivo más el ida y vuelta de red. Está bien para un mensaje de voz en el que el usuario no espera respuesta en vivo. No está bien para una conversación.

faster-whisper autohospedado sobre GPU es mucho más rápido que la API alojada, pero sigue siendo por lotes por diseño. Los wrappers de la comunidad simulan streaming metiendo bloques de audio de tamaño fijo por el modelo y cosiendo las salidas, lo que suele añadir entre dos y cinco segundos de latencia por bloque y produce esa sensación clásica de "espera, por favor". Si tienes que autohospedar y quieres tiempo real, estás mirando una arquitectura distinta (detección de actividad de voz propia, calentamiento del modelo, solapamiento de bloques) que es un proyecto en sí.

Así que: si la respuesta llega después de que el usuario termine de hablar, cualquiera de los dos motores vale. Si la respuesta tiene que sentirse como una intervención humana, Deepgram es la elección por defecto.

Coste: los números que sí atan

Deepgram Nova-3 cotiza a 0,0043 dólares por minuto para audio pregrabado y entre 0,0058 y 0,0077 por minuto para streaming, facturado al segundo. La API Whisper Large v3 de OpenAI cuesta 0,006 por minuto, y gpt-4o-mini-transcribe cuesta 0,003 por minuto. La variante en tiempo real gpt-realtime-whisper cuesta 0,017 por minuto.

Autohospedar faster-whisper en una GPU dedicada baja el coste marginal a unos 0,0003 dólares por minuto en el rango de 1.000 horas al mes - unas 14 veces más barato que Deepgram a escala - pero esa cifra asume que la GPU está a plena carga. En volumen bajo, el coste lo domina el alquiler fijo por hora de la GPU y autohospedar sale más caro, no más barato.

El punto de cruce para un bot típico de un fundador en solitario está en torno a las 100 horas de audio al mes. Por debajo, las APIs alojadas ganan en coste total incluyendo tu tiempo. Por encima, autohospedar empieza a merecer la pena. Casi ningún bot de voz personal o de equipo pequeño está por encima de esa línea.

La regla que lo decide

Aquí va la única regla que te ahorra correr un benchmark:

  • Conversación en tiempo real como objetivo (respuestas de voz esperadas en menos de un segundo, turnos naturales, llamadas): Deepgram. Usa Flux si quieres la detección de fin de turno integrada, Nova-3 si quieres el STT en crudo.
  • El usuario graba, el bot responde después (memos de voz de Telegram, notas de audio de WhatsApp, transcripción de clips más largos): Whisper vía la API de OpenAI. Más barato, más preciso en formato largo, sin desventaja real de latencia.
  • Tienes volumen serio y quieres ser dueño del stack (más de 100 horas de audio al día, los datos deben quedarse en tu propio hardware): faster-whisper autohospedado en GPU. Presupuesta una persona para mantener el wrapper.

Para un bot típico de Telegram donde el usuario manda un memo de voz y espera respuesta en unos segundos, Whisper es la elección correcta y Deepgram es exagerado. Para un agente nativo de teléfono que tenga que sostener una conversación, ahí Deepgram se gana su precio.

Dónde encaja Hermes Agent

Si estás corriendo Hermes Agent en Telegram o WhatsApp, casi con toda seguridad quieres la ruta Whisper. Los memos de voz son la forma común, el usuario está acostumbrado a una respuesta de dos o tres segundos, y la API alojada de OpenAI Whisper entra sin infraestructura. La guía del modo voz de Hermes Agent explica cómo se cablea el hueco de STT dentro del gateway.

Si estás usando Hermes para atender llamadas de voz en vivo o un canal donde la respuesta tiene que sentirse interruptiva, Deepgram Nova-3 o Flux es la elección honesta, y los pocos céntimos extra por hora te compran una conversación que no suena a walkie-talkies. Del lado de TTS de la tubería, nuestro repaso de proveedores TTS tiene las opciones honestas para la mitad de respuesta de la conversación.

Si prefieres no gestionar nada de esto por tu cuenta, empieza con Hermify - el Hermes Agent gestionado en Telegram te da memoria persistente, respuestas de voz y un bot en línea en aproximadamente un minuto. El STT y el TTS ya están conectados, y puedes cambiar de proveedor cuando cambie tu patrón de uso sin tocar infraestructura.

Resumen

Deepgram gana en tiempo real. Whisper gana en lotes y en coste. La diferencia de tasa de error por palabra es real pero no es lo que decide entre ellos - la arquitectura de streaming sí. Elige Deepgram cuando el usuario espera la respuesta mientras aún está hablando; elige Whisper cuando al usuario le vale esperar los dos segundos que un memo de voz tarda de forma natural; elige faster-whisper autohospedado solo cuando tu volumen y tus necesidades de privacidad justifiquen ser dueño del stack.

Si estás montando un bot de voz y no tienes claro de qué lado de la línea estás, empieza con Whisper. Es más barato, más fácil y, si te queda pequeño, Deepgram es un cambio de una línea. En el otro sentido es una reescritura.

Sources

Lanza tu propio agente Hermes

Trae tu clave de API, conecta Telegram y ten un agente de IA que evoluciona solo activo en 60 segundos.

Empezar