Zurück zum Blog
HermesAI AgentsModels

Hermes 4 vs Hermes 3: Was sich geändert hat und was Sie wählen sollten

Ein konkreter Vergleich der Hermes 4- und Hermes 3-Modellfamilien von Nous Research, mit einem Entscheidungsleitfaden für Hermes Agent BYOK.

Von Hermify Team||6 Min. Lesezeit
Geteilte Bildschirmgrafik, die einen Hermes 3-Schriftzug einem Hermes 4-Schriftzug auf dunklem Hintergrund gegenüberstellt, getrennt durch eine schmale grüne Linie

Was sich zwischen Hermes 3 und Hermes 4 geändert hat

Hermes 3 wurde 2024 von Nous Research veröffentlicht und war eine Familie vollständiger Fine-Tunes von Llama 3.1 in den Größen 8B, 70B und 405B. Der Fokus lag auf neutraler Ausrichtung und Steuerbarkeit: ein starker, unzensierter Assistent, der tat, worum Sie ihn baten, ohne eigene Meinungen einzubringen. Er argumentierte standardmäßig nicht Schritt für Schritt. Er antwortete.

Hermes 4, veröffentlicht im August 2025, ist ein anderes Tier. Er kommt in drei Größen (14B auf Basis von Qwen 3, 70B und 405B auf Basis von Llama 3.1) und ergänzt einen hybriden Argumentationsmodus, in dem das Modell entscheidet, ob es in <think>...</think>-Spuren nachdenkt, bevor es antwortet. Der Post-Training-Korpus wuchs um etwa das Fünfzigfache: von rund 1M Stichproben und 1,2B Tokens bei Hermes 3 auf etwa 5M Stichproben und 60B Tokens bei Hermes 4, gemischt aus Argumentations- und Nicht-Argumentationsdaten. Das Training lief auf 192 NVIDIA B200 GPUs.

Im Dezember 2025 veröffentlichte Nous dann Hermes 4.3 36B. Er basiert auf der Seed-OSS-36B-Architektur von ByteDance, erweitert den Kontext auf 512K Tokens und wurde vollständig auf dem dezentralen Psyche-Netzwerk von Nous post-trainiert. Er kommt in Auswertungen nahe an Hermes 4 70B heran, bei halber Parameterzahl.

Wenn Sie Hermes Agent mit Ihrem eigenen API-Schlüssel für OpenRouter oder direkt für Nous betreiben, ist die Modellwahl inzwischen wirklich interessant. Hier ist, was sich tatsächlich unterscheidet und wie Sie wählen.

Die Hermes 4-Familie auf einen Blick

Modell Basis Argumentationsmodus Am besten geeignet für
Hermes 4 14B Qwen 3 14B Ja Lokale Inferenz, Edge-Geräte, günstige Entwürfe
Hermes 4 70B Llama 3.1 70B Ja Kostenbewusste BYOK-Workloads mit echtem Qualitätsanspruch
Hermes 4 405B Llama 3.1 405B Ja Spitzen-Argumentation: Mathematik, Code, anspruchsvolle MINT-Fragen
Hermes 4.3 36B Seed-OSS 36B Ja Arbeit mit 512K Kontext, lokales Selbsthosten auf einer GPU

Alle vier teilen sich denselben Trick des hybriden Argumentierens: ein Satz Gewichte, ein Schalter. Sie müssen kein separates „Reasoning"-Modell und kein separates „Instruct"-Modell pflegen.

Hybrides Argumentieren: die wichtigste Funktion

Bei Hermes 3 erhielten Sie eine direkte Antwort. Schnell, kompetent, erledigt.

Bei Hermes 4 können Sie beides auf demselben Checkpoint anfordern. Ist der Argumentationsmodus aktiv, gibt das Modell einen <think>...</think>-Block mit seiner internen Überlegung aus und danach eine finale Antwort. Ist er aus, antwortet das Modell direkt, so wie es Hermes 3 tat.

Zwei Konsequenzen für Ihren Einsatz in Hermes Agent:

  • Sie benötigen keine zwei Anbieter-Slots. Richten Sie BYOK auf ein einziges Hermes 4-Modell und wechseln Sie den Modus pro Aufgabe über einen System-Prompt oder eine Wrapper-Konvention. Günstiger und einfacher, als zwischen separaten Argumentations- und Nicht-Argumentationsmodellen zu routen.
  • Sie zahlen für die Tokens, die das Modell zum Nachdenken aufgewendet hat. Der Argumentationsmodus ist nicht kostenlos. Ein langer <think>-Block kann die Ausgabekosten einer schwierigen Frage leicht verdoppeln. Lassen Sie ihn bei Routinezusammenfassungen oder Smalltalk aus.

Wenn Sie ein besseres Gefühl dafür bekommen möchten, wie sich ein argumentierender Agent im Alltag verhält, zeigt unser Beitrag Speicher und Skills von Hermes Agent, wie Speicherdateien beeinflussen, worüber der Agent überhaupt nachdenkt.

Benchmarks: Was die Zahlen wirklich zeigen

An der Spitze meldet Hermes 4 405B im Argumentationsmodus:

  • MATH-500: 96,3
  • AIME'24: 81,9
  • GPQA Diamond: 70,5
  • LiveCodeBench: 61,3

Das ist konkurrenzfähig mit DeepSeek R1 671B und Qwen 3 235B, und das bei offenen Gewichten. Die 96,3 auf MATH-500 sind real, aber betrachten Sie sie als Obergrenze für einen bestimmten Fragetyp und nicht als Versprechen für jeden Prompt: Bei Aufgaben ohne Argumentation verhält sich dasselbe Modell eher wie ein gut abgestimmtes Llama 3.1 405B als wie ein Spitzen-Reasoner.

Hermes 4 70B tauscht einige Punkte in den harten Argumentations-Benchmarks gegen etwa sechsmal günstigere Inferenz. Hermes 4 14B ist der stille Star: klein genug, um auf einer einzigen Consumer-GPU zu laufen, und behält das hybride Argumentieren bei, was in dieser Größe ungewöhnlich ist.

Am spannendsten zu beobachten ist Hermes 4.3 36B. Nous meldet, dass er Hermes 4 70B mit der Hälfte der Parameter fast erreicht, dank der größeren Seed-OSS-Basis und des verteilten Post-Trainings auf Psyche. Er verfügt zudem über ein Kontextfenster von 512K, das der 70B nicht bietet.

Welches Modell in Hermes Agent laufen lassen

Hermes Agent ist modellagnostisch. Sie wählen in der config.yaml oder über die OpenRouter-Einrichtung für Hermes Agent, und das Framework kümmert sich um den Rest. Faustregel für BYOK-Anwender:

  • Zusammenfassung langer Kontexte, lange Chat-Historien, Code-Review großer Dateien. Wählen Sie Hermes 4.3 36B. Das 512K-Fenster ist der entscheidende Faktor. Nichts anderes in der Familie kommt hier heran.
  • Harte Argumentation: Mathematik, neuer Code, agentische Planung mit vielen Schritten. Wählen Sie Hermes 4 405B im Argumentationsmodus. Schalten Sie ihn bei Routine ab und bei schweren Anfragen wieder ein.
  • Kostenbewusstes Alltagsmodell. Wählen Sie Hermes 4 70B. Das ist der ausgewogene Standard. Gute Antworten, vernünftiger Preis, und weiterhin hybrides Argumentieren, wenn Sie es brauchen.
  • Edge, lokal oder Offline-Läufe. Wählen Sie Hermes 4 14B oder Hermes 4.3 36B, wenn Sie eine kräftigere GPU haben. Die 14B-GGUFs laufen komfortabel auf einer einzelnen Karte der Mittelklasse.
  • Sie haben ein funktionierendes Hermes 3-Setup, das zu Ihrem Workload passt. Migrieren Sie nicht um der Migration willen. Hermes 3 405B ist weiterhin ein starker, nicht argumentierender Assistent. Wechseln Sie nur, wenn Sie eine der vier oben genannten Fähigkeiten benötigen.

Für eine umfassendere Sicht auf die Wahl der Anbieterschicht siehe unseren Vergleich Hermes Agent verwaltetes Hosting vs selbst gehostet. Die Modellwahl ist weitgehend unabhängig davon, wo Sie den Agenten betreiben.

So wechseln Sie das Modell in Hermes Agent

Der Wechsel ist eine Konfigurationsänderung, kein Neubau. In ~/.hermes/config.yaml:

model:
  provider: openrouter
  name: nousresearch/hermes-4-405b
  # Für direkten Zugriff auf Nous verwenden Sie:
  # provider: nous
  # name: hermes-4-405b

Starten Sie das Gateway neu:

hermes gateway restart

Für den Argumentationsmodus akzeptieren die meisten Hermes 4-Modelle ein reasoning: true- oder enable_thinking: true-Flag auf Anbieterseite, oder Sie umschließen Ihren Prompt auf System-Prompt-Ebene mit einer expliziten <think>-Anweisung. Prüfen Sie die Dokumentation Ihres Anbieters, bevor Sie Standardwerte annehmen.

Wenn Sie BYOK über ein verwaltetes Hosting nutzen, ist der Wechsel noch einfacher: Ändern Sie den Modellnamen im Dashboard und senden Sie eine neue Nachricht. Kein Neustart, kein Image-Rebuild.

Fazit

Der Sprung von Hermes 3 zu Hermes 4 ist größer, als es die Versionsnummer vermuten lässt. Sie kommen von einem starken Llama-3.1-Fine-Tune mit guter Steuerbarkeit zu einer Familie mit hybridem Argumentieren, konkurrenzfähigen Spitzen-Benchmarks, einem verteilten Trainingspipeline (4.3) und einer echten Option für lange Kontexte. Die Migration ist eine Konfigurationsänderung, wenn Sie Hermes Agent bereits betreiben, und der ROI ist am höchsten bei Workloads mit echter Argumentation, langem Kontext oder einer Mischung aus beidem.

Wählen Sie das kleinste Modell der Familie, das Ihre schwierigste Frage noch gut beantwortet. Aktivieren Sie den Argumentationsmodus nur, wenn Sie ihn wirklich brauchen. Und behalten Sie die Psyche-Netzwerk-Releases im Auge: Das 4.3-Muster (kleinere Basis, mehr Post-Training, dezentraler Lauf) ist mit hoher Wahrscheinlichkeit die Form der nächsten Hermes-Releases.

Starten Sie mit Hermify, wenn der Modellwechsel bei Ihnen ein Dropdown statt einer Konfigurationsdatei sein soll, mit einem Hermes Agent, der auf Telegram läuft, während Sie sich entscheiden.

Quellen

Betreiben Sie Ihren eigenen Hermes Agent

Bringen Sie Ihren API-Schlüssel mit, verbinden Sie Telegram und erhalten Sie in 60 Sekunden einen selbstlernenden KI-Agenten.

Loslegen