Torna al blog
VoiceSTTAI AgentsHermes

Deepgram vs Whisper per agenti vocali IA: scelta onesta

Quale STT scegliere per il tuo agente vocale IA? Deepgram Nova-3 e Whisper a confronto su latenza, precisione, costo e streaming per bot in tempo reale.

Di Hermify Team||8 min di lettura
Il logotipo di Deepgram a sinistra e quello di OpenAI Whisper a destra, separati da una sottile linea verticale verde su sfondo scuro, con la scritta Deepgram vs Whisper

La domanda non è quale sia più preciso

Se il tuo agente vocale ci mette tre secondi a rispondere dopo che l'utente ha finito di parlare, non importa che il motore di riconoscimento vocale abbia trascritto ogni parola correttamente. L'utente ha già mollato e ha scritto. La domanda onesta quando scegli tra Deepgram e Whisper per un agente vocale IA non è quindi "quale ha il word error rate più basso" - su audio pulito sono abbastanza vicini per un chatbot. È "quale mi permette di rispondere dentro la finestra in cui una persona si sente ancora ascoltata".

Quella finestra è di circa 800 millisecondi end-to-end, dal momento in cui l'utente smette di parlare fino a quando il tuo bot inizia a rispondere, e lo STT è di solito il primo punto in cui salta. Questo post è la sintesi onesta: cosa fa davvero ciascun motore, quanto costano quando li fai girare per un vero bot vocale su Telegram o WhatsApp, e la singola regola che decide tra i due senza che tu debba lanciare un benchmark tuo.

Cosa stai davvero scegliendo

Deepgram è una API in cloud. Mandi l'audio ai loro server, loro restituiscono le trascrizioni. Nova-3 è il modello di punta attuale e Flux è la variante più recente, tarata specificamente per agenti vocali, con rilevamento del fine turno integrato, così il bot sa quando l'utente ha smesso di parlare senza che tu scriva quella logica. Deepgram dichiara una latenza P50 in streaming tra 200 e 300 millisecondi in produzione, ed è il numero che conta per il tempo reale.

Whisper è un modello a pesi aperti di OpenAI. Puoi usare la API in cloud di OpenAI oppure far girare una delle reimplementazioni della community (faster-whisper, whisper.cpp) sul tuo hardware. Il modello di riferimento Whisper Large v3 ha circa 1,55 miliardi di parametri e sui benchmark puliti standard fa circa il 10 per cento di word error rate. È un modello pensato per elaborazione a lotti - gli dai un pezzo di audio, ti restituisce la trascrizione, e nell'implementazione di riferimento non c'è un vero percorso di streaming.

Questa è tutta la differenza in una frase: Deepgram è fatto per rispondere mentre stai ancora parlando, e Whisper è fatto per rispondere con precisione dopo che hai finito. Tutto il resto in questo confronto è una conseguenza di quello.

Precisione: più vicini di quanto i benchmark suggeriscano

Sulla carta, Deepgram Nova-3 fa tra il 5,26 e il 6,84 per cento di word error rate in produzione, contro circa il 10 per cento di Whisper Large v3. È un divario reale e regge nei confronti pubblicati dalla stessa Deepgram. Ma un benchmark indipendente pubblicato a luglio 2026, su 14 modelli STT e 904 file audio, ha trovato Nova-3 in inglese a una media del 12,3 per cento di WER, sostanzialmente in pari con Whisper-1 all'11,9 per cento, e AssemblyAI Universal-3.5 avanti a entrambi al 7,0 per cento.

Il divario tra "numero pubblicato da Deepgram" e "numero da benchmark indipendente" non è disonestà. È che il word error rate è enormemente sensibile all'audio che gli tiri: accento, rumore, vocabolario specifico, frequenza di campionamento, codec. Nova-3 vince su audio pulito di meeting in inglese e perde sulle altre lingue, e faster-whisper Large v3 auto-ospitato ha addirittura registrato il 4,2 per cento di WER in un testa a testa contro Deepgram Nova-2 al 6,7 per cento.

La conclusione onesta: sul tipo di audio che il tuo bot vocale vedrà davvero - qualcuno che parla al microfono di un telefono, in una delle lingue che supporti, con rumore ambientale - entrambi i motori sono dentro la fascia di precisione in cui la trascrizione è utilizzabile. Se la precisione è il tuo fattore differenziante, lancia un piccolo benchmark sulle tue registrazioni. Per la maggior parte degli agenti non è il fattore differenziante. La latenza sì.

Latenza: il vero fattore decisivo

L'API di streaming di Deepgram restituisce trascrizioni parziali mentre l'utente sta ancora parlando. La latenza end-to-end si assesta intorno ai 200-300 millisecondi in produzione. La variante Flux è tarata specificamente per gli agenti vocali, con rilevamento del fine turno integrato nel modello, così la pipeline sa quando l'utente ha finito senza che tu ci imbulloni sopra un rilevatore di attività vocale separato.

Whisper via API di OpenAI è a lotti. Mandi il file, ricevi la risposta, e il "quanto ci è voluto" dipende dalla lunghezza del file più il round-trip di rete. Va benissimo per un messaggio vocale in cui l'utente non aspetta una risposta live. Non va bene per una conversazione.

faster-whisper auto-ospitato su GPU è molto più veloce della API in cloud, ma resta a lotti per design. I wrapper della community simulano lo streaming spingendo blocchi di audio di dimensione fissa attraverso il modello e cucendo insieme gli output, il che aggiunge di solito da due a cinque secondi di latenza per blocco e produce il classico effetto "attendere prego". Se devi auto-ospitare e vuoi il tempo reale, stai guardando un'architettura diversa (rilevatore di attività vocale tuo, warm-up del modello, sovrapposizione dei blocchi) che è un progetto a sé.

Quindi: se la risposta arriva dopo che l'utente ha finito di parlare, entrambi i motori vanno bene. Se la risposta deve sembrare un'interruzione umana, Deepgram è la scelta di default.

Costo: i numeri che davvero pesano

Deepgram Nova-3 si paga 0,0043 dollari al minuto per audio preregistrato e tra 0,0058 e 0,0077 al minuto in streaming, fatturato al secondo. L'API Whisper Large v3 di OpenAI costa 0,006 al minuto, e gpt-4o-mini-transcribe costa 0,003 al minuto. La variante in tempo reale gpt-realtime-whisper costa 0,017 al minuto.

Auto-ospitare faster-whisper su una GPU dedicata abbassa il costo marginale a circa 0,0003 dollari al minuto nella fascia delle 1.000 ore al mese - circa 14 volte più economico di Deepgram su scala - ma quel numero presuppone che la GPU sia a pieno carico. A basso volume il costo è dominato dal noleggio orario fisso della GPU e auto-ospitare esce più caro, non più economico.

Il punto di pareggio per un tipico bot di un fondatore in solo è intorno alle 100 ore di audio al mese. Sotto, le API in cloud vincono sul costo totale incluso il tuo tempo. Sopra, auto-ospitare inizia a contare. Quasi nessun bot vocale personale o di piccolo team sta sopra quella linea.

La regola che decide

Ecco la singola regola che ti risparmia un benchmark:

  • La conversazione in tempo reale è lo scopo (risposte vocali attese in meno di un secondo, turni naturali, chiamate telefoniche): Deepgram. Usa Flux se vuoi il rilevamento del fine turno già pronto, Nova-3 se vuoi lo STT nudo.
  • L'utente registra, il bot risponde dopo (memo vocali Telegram, note audio WhatsApp, trascrizione di clip più lunghi): Whisper via API di OpenAI. Più economico, più preciso sul formato lungo, senza svantaggi reali di latenza.
  • Hai volume serio e vuoi possedere lo stack (oltre 100 ore di audio al giorno, i dati devono restare sul tuo hardware): faster-whisper auto-ospitato su GPU. Metti a budget una persona che mantiene il wrapper.

Per un tipico bot Telegram in cui l'utente manda un memo vocale e si aspetta la risposta in pochi secondi, Whisper è la scelta giusta e Deepgram è esagerato. Per un agente nativo per il telefono che deve reggere una conversazione, lì Deepgram si guadagna il suo prezzo.

Dove si inserisce Hermes Agent

Se stai facendo girare Hermes Agent su Telegram o WhatsApp, quasi sicuramente vuoi il percorso Whisper. I memo vocali sono la forma più comune, l'utente è abituato a una risposta di due o tre secondi, e la API in cloud di OpenAI Whisper si aggancia senza infrastruttura. La guida alla modalità vocale di Hermes Agent mostra come lo slot STT viene cablato nel gateway.

Se stai usando Hermes per gestire chiamate vocali live o un canale in cui la risposta deve sembrare interruttiva, Deepgram Nova-3 o Flux è la scelta onesta, e i pochi centesimi in più all'ora ti comprano una conversazione che non suona da walkie-talkie. Sul lato TTS della pipeline, la nostra panoramica dei provider TTS ha le scelte oneste per la metà di risposta della conversazione.

Se preferisci non gestire niente di tutto questo di persona, inizia con Hermify - Hermes Agent gestito su Telegram ti dà memoria persistente, risposte vocali e un bot online in circa un minuto. STT e TTS sono già collegati, e puoi cambiare provider quando cambia il tuo pattern di uso senza toccare infrastruttura.

Riepilogo

Deepgram vince sul tempo reale. Whisper vince sui lotti e sul costo. La differenza di word error rate è reale ma non è quello che decide tra i due - decide l'architettura di streaming. Scegli Deepgram quando l'utente aspetta la risposta mentre sta ancora parlando; scegli Whisper quando all'utente sta bene aspettare i due secondi che un memo vocale naturalmente richiede; scegli faster-whisper auto-ospitato solo quando il tuo volume e le tue esigenze di privacy giustificano possedere lo stack.

Se stai costruendo un bot vocale e non sei sicuro da che lato della linea sei, parti con Whisper. È più economico, più semplice, e se lo superi, Deepgram è uno swap di una riga. Nell'altro senso è una riscrittura.

Sources

Avvia il tuo Hermes Agent

Porta la tua chiave API, collega Telegram e ottieni un agente IA che migliora da solo, online in 60 secondi.

Inizia ora