Zurück zum Blog
VoiceSTTAI AgentsHermes

Deepgram vs. Whisper für KI-Sprachagenten: Ehrliche Wahl

Welches STT eignet sich für Ihren KI-Sprachagenten? Deepgram Nova-3 und Whisper im Vergleich: Latenz, Genauigkeit, Kosten und Streaming für Echtzeit-Bots.

Von Hermify Team||7 Min. Lesezeit
Der Deepgram-Schriftzug links und der OpenAI-Whisper-Schriftzug rechts, getrennt durch eine dünne grüne senkrechte Linie auf dunklem Hintergrund, mit dem Text Deepgram vs Whisper

Die Frage ist nicht, welches Modell genauer ist

Wenn Ihr Sprachagent drei Sekunden braucht, um zu antworten, nachdem der Nutzer aufgehört hat zu sprechen, spielt es keine Rolle, dass Ihr Spracherkennungsmodul jedes Wort richtig transkribiert hat. Der Nutzer hat längst aufgegeben und getippt. Die ehrliche Frage bei der Wahl zwischen Deepgram und Whisper für einen KI-Sprachagenten lautet also nicht „welches hat die niedrigere Wortfehlerrate" - bei sauberem Audio liegen beide für einen Chatbot nah genug beieinander. Sie lautet „welches erlaubt mir, innerhalb des Zeitfensters zu antworten, in dem sich ein Mensch noch gehört fühlt".

Dieses Fenster ist Ende-zu-Ende ungefähr 800 Millisekunden lang, vom Moment, in dem der Nutzer aufhört zu sprechen, bis Ihr Bot mit der Antwort beginnt, und das STT ist meist die erste Stelle, an der es zerreißt. Dieser Beitrag ist die ehrliche Aufschlüsselung: Was jedes Modul tatsächlich leistet, was es kostet, wenn Sie es für einen echten Sprachbot auf Telegram oder WhatsApp betreiben, und die eine Regel, die zwischen beiden entscheidet, ohne dass Sie ein eigenes Benchmark fahren müssen.

Was Sie wirklich vergleichen

Deepgram ist eine gehostete API. Sie senden Audio an die Server, die Transkripte kommen zurück. Nova-3 ist das derzeit stärkste Modell und Flux die neuere Variante, speziell auf Sprachagenten zugeschnitten, mit integrierter Ende-eines-Turns-Erkennung, damit der Bot weiß, wann der Nutzer fertig gesprochen hat, ohne dass Sie diese Logik selbst schreiben. Deepgram veröffentlicht eine P50-Streaming-Latenz von 200 bis 300 Millisekunden unter Produktionsbedingungen, und das ist die Zahl, die in Echtzeit zählt.

Whisper ist ein Modell mit offenen Gewichten von OpenAI. Sie können die gehostete OpenAI-API nutzen oder eine der Community-Reimplementierungen (faster-whisper, whisper.cpp) auf eigener Hardware betreiben. Das Referenzmodell Whisper Large v3 hat rund 1,55 Milliarden Parameter und erreicht in den üblichen sauberen Benchmarks eine Wortfehlerrate von etwa 10 Prozent. Es ist ein batch-orientiertes Modell - Sie übergeben ein Audio-Stück, es liefert das Transkript, und in der Referenzimplementierung gibt es keinen echten Streaming-Pfad.

Das ist der ganze Unterschied in einem Satz: Deepgram ist dafür gebaut, zu antworten, während Sie noch sprechen, und Whisper ist dafür gebaut, präzise zu antworten, nachdem Sie fertig sind. Alles Weitere in diesem Vergleich ist eine Folge davon.

Genauigkeit: näher beieinander, als die Benchmarks vermuten lassen

Auf dem Papier liefert Deepgram Nova-3 in der Produktion 5,26 bis 6,84 Prozent Wortfehlerrate, gegenüber rund 10 Prozent bei Whisper Large v3. Das ist ein realer Abstand, und er hält in den von Deepgram selbst veröffentlichten Vergleichen. Ein unabhängiges Benchmark aus Juli 2026, über 14 STT-Modelle und 904 Audiodateien hinweg, ergab jedoch Nova-3 auf Englisch mit einem Durchschnitt von 12,3 Prozent WER, praktisch gleichauf mit Whisper-1 bei 11,9 Prozent, und AssemblyAI Universal-3.5 vor beiden bei 7,0 Prozent.

Die Lücke zwischen „von Deepgram publizierter Zahl" und „unabhängiger Benchmark-Zahl" ist keine Unehrlichkeit. Sie zeigt, dass die Wortfehlerrate extrem empfindlich auf das eingespeiste Audio reagiert: Akzent, Störgeräusche, Fachvokabular, Abtastrate, Codec. Nova-3 gewinnt bei sauberem englischen Meeting-Audio und verliert bei anderen Sprachen, und selbst gehostetes faster-whisper Large v3 hat in einem direkten Vergleich mit Deepgram Nova-2 sogar 4,2 Prozent WER erreicht, während Nova-2 bei 6,7 Prozent lag.

Die ehrliche Erkenntnis: Bei der Art von Audio, die Ihr Sprachbot tatsächlich verarbeitet - eine Person, die in ein Handy-Mikrofon spricht, in einer der von Ihnen unterstützten Sprachen, mit Raumgeräuschen - liegen beide Module im Genauigkeitsband, in dem das Transkript brauchbar ist. Wenn Genauigkeit Ihr Alleinstellungsmerkmal ist, führen Sie ein kleines Benchmark mit eigenen Aufnahmen durch. Für die meisten Agenten ist Genauigkeit nicht das Alleinstellungsmerkmal. Latenz ist es.

Latenz: der wirklich entscheidende Faktor

Die Streaming-API von Deepgram liefert Teiltranskripte, während der Nutzer noch spricht. Die Ende-zu-Ende-Latenz landet in der Produktion bei etwa 200 bis 300 Millisekunden. Die Flux-Variante ist speziell für Sprachagenten zugeschnitten, mit modellintegrierter Ende-eines-Turns-Erkennung, damit die Pipeline weiß, wann der Nutzer fertig ist, ohne dass Sie einen separaten Sprachaktivitätsdetektor drangeschraubt bekommen.

Whisper über die OpenAI-API läuft im Batch. Sie senden die Datei, Sie erhalten die Antwort, und das „wie lange hat das jetzt gedauert" hängt von der Länge der Datei plus dem Netzwerk-Roundtrip ab. Für eine Sprachnachricht, bei der der Nutzer keine Live-Antwort erwartet, ist das in Ordnung. Für eine Unterhaltung nicht.

Selbst gehostetes faster-whisper auf einer GPU ist deutlich schneller als die gehostete API, aber immer noch batchbasiert. Community-Wrapper simulieren Streaming, indem sie Audio-Chunks fester Größe durch das Modell schicken und die Ausgaben zusammennähen, was pro Chunk typischerweise zwei bis fünf Sekunden Latenz addiert und dieses klassische „Bitte warten" hervorruft. Wer selbst hosten und Echtzeit erreichen will, schaut auf eine andere Architektur (eigene Sprachaktivitätserkennung, Modell-Warmup, Chunk-Überlappung) und das ist ein Projekt für sich.

Also: Wenn die Antwort erst kommt, nachdem der Nutzer fertig gesprochen hat, funktionieren beide Module. Soll sich die Antwort wie eine menschliche Zwischenfrage anfühlen, ist Deepgram die Voreinstellung.

Kosten: die Zahlen, die wirklich binden

Deepgram Nova-3 wird mit 0,0043 US-Dollar pro Minute für vorab aufgenommenes Audio und 0,0058 bis 0,0077 pro Minute im Streaming abgerechnet, sekundengenau. Die Whisper-Large-v3-API von OpenAI kostet 0,006 pro Minute, gpt-4o-mini-transcribe liegt bei 0,003 pro Minute. Die Echtzeit-Variante gpt-realtime-whisper kostet 0,017 pro Minute.

Selbst gehostetes faster-whisper auf einer dedizierten GPU drückt die Grenzkosten auf etwa 0,0003 US-Dollar pro Minute im Bereich von 1.000 Stunden pro Monat - grob 14-mal günstiger als Deepgram bei Skalierung - aber diese Zahl setzt voraus, dass die GPU voll ausgelastet ist. Bei geringem Volumen dominieren die festen Stundenkosten der GPU, und Selbst-Hosten wird teurer, nicht günstiger.

Der Break-even für einen typischen Solo-Gründer-Bot liegt bei rund 100 Stunden Audio pro Monat. Darunter gewinnen die gehosteten APIs bei den Gesamtkosten inklusive Ihrer Zeit. Darüber beginnt Selbst-Hosten zu zählen. Kaum ein persönlicher oder kleiner Team-Sprachbot liegt über dieser Linie.

Die Regel, die entscheidet

Hier ist die eine Regel, die Ihnen ein eigenes Benchmark erspart:

  • Echtzeit-Konversation ist das Ziel (Sprachantwort innerhalb einer Sekunde erwartet, natürliche Sprecherwechsel, Telefonanrufe): Deepgram. Nehmen Sie Flux, wenn Sie die Ende-eines-Turns-Erkennung integriert wollen, Nova-3 für das reine STT.
  • Der Nutzer nimmt auf, der Bot antwortet später (Telegram-Sprachmemos, WhatsApp-Sprachnachrichten, Transkription längerer Clips): Whisper über die OpenAI-API. Günstiger, präziser im Langformat, ohne relevanten Latenznachteil.
  • Sie haben echtes Volumen und wollen den Stack besitzen (mehr als 100 Stunden Audio pro Tag, die Daten müssen auf eigener Hardware bleiben): selbst gehostetes faster-whisper auf einer GPU. Planen Sie eine Person für die Pflege des Wrappers ein.

Für einen typischen Telegram-Bot, bei dem der Nutzer eine Sprachnachricht schickt und in wenigen Sekunden eine Antwort erwartet, ist Whisper die richtige Wahl und Deepgram überdimensioniert. Für einen telefonnativen Agenten, der eine Unterhaltung tragen muss, verdient sich Deepgram seinen Preis.

Wo Hermes Agent hineinpasst

Wenn Sie Hermes Agent auf Telegram oder WhatsApp betreiben, wollen Sie mit hoher Wahrscheinlichkeit den Whisper-Pfad. Sprachnachrichten sind die übliche Form, der Nutzer ist an eine Antwort in zwei bis drei Sekunden gewöhnt, und die gehostete OpenAI-Whisper-API lässt sich ohne eigene Infrastruktur einbinden. Der Leitfaden zum Sprachmodus von Hermes Agent zeigt, wie der STT-Slot ans Gateway angebunden wird.

Wenn Sie Hermes für Live-Sprachanrufe oder einen Kanal einsetzen, bei dem die Antwort unterbrechend wirken muss, ist Deepgram Nova-3 oder Flux die ehrliche Wahl, und die paar Cent zusätzlich pro Stunde kaufen Ihnen eine Unterhaltung, die nicht wie ein Walkie-Talkie klingt. Auf der TTS-Seite der Pipeline liefert unser Überblick zu TTS-Anbietern die ehrlichen Empfehlungen für die Antworthälfte des Gesprächs.

Wenn Sie das lieber nicht selbst betreiben möchten, starten Sie mit Hermify - der verwaltete Hermes Agent auf Telegram bietet persistenten Speicher, Sprachantworten und einen Bot, der in etwa einer Minute live ist. STT und TTS sind bereits verdrahtet, und Sie wechseln den Anbieter, wenn sich Ihr Nutzungsmuster ändert, ohne Infrastruktur anzufassen.

Fazit

Deepgram gewinnt Echtzeit. Whisper gewinnt Batch und Kosten. Der Unterschied bei der Wortfehlerrate ist real, aber nicht das, was zwischen beiden entscheidet - die Streaming-Architektur entscheidet. Wählen Sie Deepgram, wenn der Nutzer die Antwort erwartet, während er noch spricht; wählen Sie Whisper, wenn der Nutzer mit den zwei Sekunden lebt, die eine Sprachnachricht natürlich braucht; wählen Sie selbst gehostetes faster-whisper nur, wenn Volumen und Datenschutzanforderungen den eigenen Stack rechtfertigen.

Wenn Sie einen Sprachbot bauen und nicht sicher sind, auf welcher Seite der Linie Sie stehen, starten Sie mit Whisper. Es ist günstiger, einfacher, und wenn Sie herauswachsen, ist Deepgram ein Einzeiler-Tausch. Umgekehrt wird es eine Neuentwicklung.

Sources

Betreiben Sie Ihren eigenen Hermes Agent

Bringen Sie Ihren API-Schlüssel mit, verbinden Sie Telegram und erhalten Sie in 60 Sekunden einen selbstlernenden KI-Agenten.

Loslegen