Deepgram vs Whisper pour agents vocaux IA : choix honnête
Quel STT pour votre agent vocal IA ? Deepgram Nova-3 et Whisper comparés sur la latence, la précision, le coût et le streaming pour les bots temps réel.
La question n'est pas de savoir lequel est le plus précis
Si votre agent vocal met trois secondes à répondre après que l'utilisateur a fini de parler, peu importe que votre moteur de reconnaissance vocale ait bien transcrit chaque mot. L'utilisateur a déjà abandonné et tapé son message. La vraie question au moment de choisir entre Deepgram et Whisper pour un agent vocal IA n'est donc pas "lequel a le plus faible taux d'erreur par mot" - les deux sont assez proches sur un audio propre pour un chatbot. C'est "lequel me permet de répondre dans la fenêtre où un humain se sent encore écouté".
Cette fenêtre fait environ 800 millisecondes de bout en bout, entre le moment où l'utilisateur arrête de parler et celui où votre bot commence à répondre, et le STT est souvent le premier endroit où elle explose. Ce post est le récapitulatif honnête : ce que fait vraiment chaque moteur, ce qu'ils coûtent quand vous les utilisez pour un vrai bot vocal Telegram ou WhatsApp, et la règle unique qui tranche entre les deux sans que vous ayez à lancer votre propre benchmark.
Ce que vous choisissez vraiment
Deepgram est une API hébergée. Vous envoyez l'audio à leurs serveurs, ils renvoient les transcriptions. Nova-3 est leur modèle phare actuel et Flux est la variante plus récente, taillée spécifiquement pour les agents vocaux, avec détection de fin de tour intégrée pour que le bot sache quand l'utilisateur a fini sans que vous écriviez cette logique. Deepgram publie une latence P50 en streaming entre 200 et 300 millisecondes en production, qui est le chiffre qui compte en temps réel.
Whisper est un modèle à poids ouverts d'OpenAI. Vous pouvez appeler l'API hébergée d'OpenAI, ou lancer l'une des réimplémentations communautaires (faster-whisper, whisper.cpp) sur votre propre matériel. Le modèle de référence Whisper Large v3 compte environ 1,55 milliard de paramètres et affiche un taux d'erreur par mot d'environ 10 pour cent sur les benchmarks propres standards. C'est un modèle orienté lot - vous lui donnez un morceau d'audio, il vous rend la transcription, et il n'y a pas de vrai chemin de streaming dans l'implémentation de référence.
Voilà toute la différence en une phrase : Deepgram est fait pour répondre pendant que vous parlez encore, et Whisper est fait pour répondre avec précision une fois que vous avez fini. Tout le reste de cette comparaison en découle.
Précision : plus serré que les benchmarks ne le laissent croire
Sur le papier, Deepgram Nova-3 affiche entre 5,26 et 6,84 pour cent d'erreur par mot en production, contre environ 10 pour cent pour Whisper Large v3. C'est un écart réel et il tient dans les comparaisons publiées par Deepgram. Mais un benchmark indépendant publié en juillet 2026, sur 14 modèles de STT et 904 fichiers audio, a trouvé Nova-3 en anglais à 12,3 pour cent de WER en moyenne, à égalité avec Whisper-1 à 11,9 pour cent, et AssemblyAI Universal-3.5 devant les deux à 7,0 pour cent.
L'écart entre "chiffre publié par Deepgram" et "chiffre de benchmark indépendant" n'est pas malhonnête. C'est que le taux d'erreur par mot est extrêmement sensible à l'audio qu'on lui donne : accent, bruit, vocabulaire métier, fréquence d'échantillonnage, codec. Nova-3 gagne sur un audio de réunion propre en anglais et perd sur les autres langues, et faster-whisper Large v3 auto-hébergé a même affiché 4,2 pour cent de WER dans un face-à-face contre Deepgram Nova-2 à 6,7 pour cent.
La conclusion honnête : sur le type d'audio que votre bot vocal verra vraiment - quelqu'un qui parle au micro d'un téléphone, dans une des langues que vous couvrez, avec du bruit d'ambiance - les deux moteurs sont dans la fenêtre de précision où la transcription reste exploitable. Si la précision est votre différenciateur, lancez un petit benchmark sur vos propres enregistrements. Pour la plupart des agents ce n'est pas le différenciateur. La latence, oui.
Latence : le vrai facteur décisif
L'API de streaming de Deepgram renvoie des transcriptions partielles pendant que l'utilisateur parle encore. La latence bout à bout tourne autour de 200 à 300 millisecondes en production. Leur variante Flux est taillée spécifiquement pour les agents vocaux, avec détection de fin de tour intégrée au modèle, pour que le pipeline sache quand l'utilisateur a fini sans que vous boulonniez un détecteur d'activité vocale séparé.
Whisper via l'API OpenAI fonctionne en lot. Vous envoyez le fichier, vous recevez la réponse, et le "ça a pris combien" dépend de la durée du fichier plus l'aller-retour réseau. Ça fait le job pour un message vocal où l'utilisateur n'attend pas de réponse en direct. Pas pour une conversation.
faster-whisper auto-hébergé sur GPU est bien plus rapide que l'API hébergée, mais c'est toujours du lot par conception. Les wrappers communautaires simulent le streaming en poussant des morceaux d'audio de taille fixe dans le modèle et en cousant les sorties, ce qui ajoute typiquement deux à cinq secondes de latence par morceau et produit ce ressenti classique de "veuillez patienter". Si vous devez auto-héberger et que vous voulez du temps réel, vous êtes sur une autre architecture (détection d'activité vocale maison, préchauffage du modèle, chevauchement des morceaux) qui est un projet à part entière.
Donc : si la réponse arrive après que l'utilisateur a fini de parler, l'un ou l'autre moteur convient. Si la réponse doit ressembler à une interruption humaine, Deepgram est le choix par défaut.
Coût : les chiffres qui tranchent vraiment
Deepgram Nova-3 est facturé 0,0043 dollars par minute d'audio préenregistré et entre 0,0058 et 0,0077 par minute en streaming, à la seconde près. L'API Whisper Large v3 d'OpenAI est à 0,006 par minute, et gpt-4o-mini-transcribe est à 0,003 par minute. La variante temps réel gpt-realtime-whisper est à 0,017 par minute.
Auto-héberger faster-whisper sur un GPU dédié fait tomber le coût marginal autour de 0,0003 dollars par minute dans la tranche 1 000 heures par mois - environ 14 fois moins cher que Deepgram à l'échelle - mais ce chiffre suppose que le GPU est à pleine charge. En petit volume, le coût est dominé par la location horaire fixe du GPU et l'auto-hébergement revient plus cher, pas moins.
Le point de bascule pour un bot typique de fondateur solo se situe autour de 100 heures d'audio par mois. En dessous, les API hébergées gagnent sur le coût total en comptant votre temps. Au-dessus, l'auto-hébergement commence à peser. Presque aucun bot vocal personnel ou de petite équipe n'est au-dessus de cette ligne.
La règle qui tranche
Voici la règle unique qui vous évite un benchmark :
- La conversation en temps réel est le but (réponses vocales attendues en moins d'une seconde, tours de parole naturels, appels téléphoniques) : Deepgram. Prenez Flux si vous voulez la détection de fin de tour intégrée, Nova-3 si vous voulez le STT brut.
- L'utilisateur enregistre, le bot répond ensuite (mémos vocaux Telegram, notes audio WhatsApp, transcription de clips plus longs) : Whisper via l'API OpenAI. Moins cher, plus précis en format long, sans inconvénient réel de latence.
- Vous avez du vrai volume et vous voulez maîtriser la stack (plus de 100 heures d'audio par jour, les données doivent rester sur votre propre matériel) :
faster-whisperauto-hébergé sur GPU. Prévoyez une personne pour maintenir le wrapper.
Pour un bot Telegram classique où l'utilisateur envoie un mémo vocal et attend une réponse en quelques secondes, Whisper est le bon choix et Deepgram est du luxe inutile. Pour un agent nativement téléphonique qui doit tenir une conversation, c'est là que Deepgram gagne son prix.
Où Hermes Agent s'inscrit
Si vous faites tourner Hermes Agent sur Telegram ou WhatsApp, vous voulez presque certainement la voie Whisper. Les mémos vocaux sont la forme la plus courante, l'utilisateur est habitué à une réponse en deux ou trois secondes, et l'API OpenAI Whisper hébergée s'intègre sans infrastructure. Le guide du mode vocal de Hermes Agent explique comment le slot STT se câble dans le gateway.
Si vous utilisez Hermes pour prendre des appels vocaux en direct ou pour un canal où la réponse doit paraître interruptive, Deepgram Nova-3 ou Flux est le choix honnête, et les quelques centimes en plus par heure vous achètent une conversation qui ne ressemble pas à du talkie-walkie. Côté TTS du pipeline, notre tour d'horizon des fournisseurs TTS donne les choix honnêtes pour la moitié réponse de la conversation.
Si vous préférez ne rien gérer de tout ça vous-même, démarrez avec Hermify - le Hermes Agent managé sur Telegram vous donne une mémoire persistante, des réponses vocales, et un bot en ligne en une minute environ. Le STT et le TTS sont déjà branchés, et vous changez de fournisseur quand votre usage évolue sans toucher à l'infrastructure.
Résumé
Deepgram gagne le temps réel. Whisper gagne le lot et le coût. La différence de taux d'erreur par mot est réelle mais ce n'est pas ce qui tranche entre les deux - l'architecture de streaming, oui. Prenez Deepgram quand l'utilisateur attend la réponse pendant qu'il parle encore ; prenez Whisper quand l'utilisateur accepte les deux secondes qu'un mémo vocal prend naturellement ; prenez faster-whisper auto-hébergé uniquement quand votre volume et vos exigences de confidentialité justifient de posséder la stack.
Si vous construisez un bot vocal et que vous ne savez pas de quel côté de la ligne vous êtes, partez sur Whisper. C'est moins cher, plus simple, et si vous le dépassez, Deepgram est un swap d'une ligne. Dans l'autre sens, c'est une réécriture.
Sources
Lancez votre propre agent Hermes
Apportez votre clé API, connectez Telegram et obtenez un agent IA auto-améliorant opérationnel en 60 secondes.
Commencer