Zurück zum Blog
HermesOpenRouterPricingModels

Günstigstes OpenRouter-Modell für Hermes Agent 2026

Die Shortlist der OpenRouter-Modelle unter 1 Dollar pro Million Tokens 2026, sortiert nach realen Tool-Calling-Lasten und monatlichen Gesamtkosten.

Von Hermify Team||6 Min. Lesezeit
Ein dunkles Dashboard mit OpenRouter-Modellpreisen vom günstigsten zum teuersten sortiert, DeepSeek an der Spitze hervorgehoben

Die Frage hinter der Frage

Wenn Sie sich bereits für OpenRouter als Anbieter entschieden haben, ist die nächste Frage nicht „welches ist das beste Modell". Sie lautet „welches ist das günstigste, das die Lasten von Hermes Agent noch gut bewältigt". Das ist eine engere Frage und sie hat 2026 eine deutlich klarere Antwort als noch vor einem Jahr.

Hermes Agent ist eine tool-lastige Laufzeit. In jedem Turn übergibt sie dem Modell einen System-Prompt, eine lange Liste von Tool-Definitionen, den aktuellen Chatverlauf und alle geöffneten Dateien. Die Ausgabeseite ist meist klein: eine kurze Antwort und ein oder zwei Tool-Aufrufe. Genau diese eingabelastige Form macht Modelle mit Cache-Rabatt so nützlich, und deshalb bedeutet „am günstigsten" hier „am günstigsten angesichts dessen, wie Hermes mit dem Modell spricht", nicht der niedrigste Listenpreis auf einer Marketingseite.

Die Shortlist unter 1 Dollar pro Million Tokens

Nachfolgend die Modelle, die auf OpenRouter im Juli 2026 sowohl bei Eingabe als auch bei Ausgabe unter 1 Dollar pro Million Tokens liegen. Die Preise sind das, was OpenRouter vom Upstream-Anbieter durchreicht. Ein technisch günstigeres Modell, das Tool-Schemata nicht sauber befolgt oder unter Last Funktionsaufrufe verliert, taucht hier nicht auf, denn ein kaputter Tool-Aufruf in Hermes Agent bedeutet, dass der gesamte Turn Tokens verschwendet und wiederholt werden muss.

Modell Eingabe $/M Ausgabe $/M Cache-Rabatt Hinweise
DeepSeek V4-Pro 0,435 0,87 Bis ~99% (Cache-Hit bei 0,003625 $/M) Solides Tool Calling, 1M-Kontext, offene Gewichte
DeepSeek V4-Flash 0,14 0,28 Cache-Hit bei 0,0028 $/M Eingabe Schnellste DeepSeek-Variante, gut für Hilfsaufgaben
GPT-4.1 Nano 0,10 0,40 Prompt-Caching beim OpenAI-Upstream Am schwächsten beim Tool-Folgen in dieser Gruppe
Gemini 2.5 Flash Lite 0,10 0,40 Kein expliziter Cache-Rabatt Schnell, brauchbares Tool Calling
Llama 4 Scout (Groq / DeepInfra) 0,08 - 0,11 0,30 - 0,34 Kein Cache-Rabatt Kürzeste Wall-Clock-Latenz, großzügige Free-Tier zum Testen

Zwei Dinge zählen mehr als die reinen Listenpreise, wenn Sie Hermes Agent gegen diese Modelle betreiben.

Erstens sendet Hermes in fast jedem Turn dieselben Tool-Definitionen. Genau dafür ist ein KV-Cache gebaut. Auf DeepSeek V4-Pro kostet ein Cache-Hit 0,003625 Dollar pro Million Eingabetokens, rund 120x weniger als ein Cache-Miss. Über eine echte Nutzungswoche hinweg dominieren die Cache-Hit-Tokens, und die effektiven Kosten pro Turn liegen deutlich unter der Schlagzeile.

Zweitens: Wenn ein Modell unter Last fehlerhafte Tool-Aufrufe zurückgibt, versucht Hermes es erneut. Jeder Retry ist ein vollständiger neuer Eingabe-Turn. Ein Modell, das 20% günstiger ist, aber 10% der Tool-Aufrufe verpatzt, wird am Ende teurer als das „teurere" Modell, das es beim ersten Anlauf richtig macht. Deshalb steht DeepSeek V4-Pro oben auf dieser Liste, obwohl einige Modelle einen niedrigeren Listenpreis haben.

Das Rezept, das die meisten wirklich wollen

Das häufigste Muster in der OpenRouter-Community für ein günstiges Hermes-Deployment ist ein Zwei-Modell-Split. Sie richten Hermes für die eigentliche Reasoning-Schleife auf ein stärkeres Modell aus und routen Hilfsaufgaben - Kontextkompression, Chat-Titel, Vision-zu-Text, Sitzungszusammenfassung - auf etwas Günstigeres.

In Ihrer ~/.hermes/config.yaml sieht das ungefähr so aus:

provider: openrouter
model: deepseek/deepseek-v4-pro
openrouter_api_key: sk-or-your-key-here

auxiliary_model:
  compression: openai/gpt-4.1-nano
  title_generation: openai/gpt-4.1-nano
  vision: google/gemini-2.5-flash-lite
  web_summary: openai/gpt-4.1-nano

Das Hauptmodell übernimmt das harte Reasoning und die Tool-Aufrufe. Das Hilfsmodell erledigt die Aufgaben, die Hermes im Hintergrund abarbeitet und die viel toleranter gegenüber einem schwächeren Modell sind. Zusammen deckt das rund 95% der Interaktionen zum niedrigstmöglichen Tarif ab.

Wenn Sie zuerst das komplette OpenRouter-Setup wollen, lesen Sie Wie man Hermes Agent mit OpenRouter konfiguriert. Dieser Beitrag setzt voraus, dass Sie bereits einen OpenRouter-Schlüssel haben und ein Modell wählen.

Wo günstige Modelle schwächeln

Der ehrliche Kompromiss auf diesem Preisniveau: Modelle unter 1 Dollar sind stark bei skill-getriebenen, wiederkehrenden Lasten und schwächer bei neuartigem, hartem Reasoning. Der Alltag von Hermes Agent - per Cron geplante Digests, RSS-Zusammenfassungen, Speichereinträge, „erinnere mich morgen", Telegram-Triage - ist genau die Last, die günstige Modelle gut bewältigen.

Wo günstige Modelle schwächeln:

  • Lange, mehrstufige Debugging-Sessions, in denen das Modell viel Zustand halten und einen Plan überarbeiten muss
  • Juristische oder medizinische Entwürfe, die kleine faktische Fehler nicht verzeihen
  • Code-Review nichttrivialer Diffs, in denen subtile semantische Punkte zählen
  • Jede Aufgabe, in der 90% korrekt schlechter ist als 100% korrekt

Für solche Fälle lautet die Antwort nicht „kaufen Sie ein größeres günstiges Modell", sondern „routen Sie nach Aufgabe". Behalten Sie DeepSeek V4-Pro (oder ein ähnliches Modell unter 1 Dollar) als Standard. Konfigurieren Sie einen Fallback auf Claude Sonnet oder GPT-4o für die spezifischen Skills, die das brauchen. Sie zahlen Spitzenpreise für den kleinen Anteil an Turns, der Spitzenqualität verlangt, und günstige Preise für die restlichen 95%.

Der Beitrag bester Modellanbieter für Hermes Agent vertieft den Kompromiss auf Anbieterebene. Dieser Beitrag ist eine Ebene enger: Wenn Sie sich schon für OpenRouter entschieden haben, auf welches konkrete Modell routen Sie?

Was das für Ihre Monatsrechnung bedeutet

Wenn Sie Hermes selbst hosten und das Modell direkt über OpenRouter bezahlen, ist die Preisstufe unter 1 Dollar das, was die Monatsrechnung wirklich klein hält. Ein täglicher Hermes-Nutzer mit ein paar Crons und einem Dutzend Hin und Her pro Tag landet mit DeepSeek V4-Pro und funktionierenden Cache-Hits typischerweise im niedrigen einstelligen Dollar-Bereich pro Monat. Starke Nutzung von Sprachmodus oder Web-Scraping treibt die Zahl nach oben, aber nicht um eine Größenordnung.

Wenn Sie im Starter-Tarif von Hermify sind, ist die Modellausgabe BYOK (eigener API-Schlüssel) über OpenRouter, sodass die obige Auswahl Ihre Monatsrechnung buchstäblich bestimmt. DeepSeek V4-Pro als Hauptmodell und einen Nano für Hilfsaufgaben zu wählen, ist das, worauf die meisten Starter-Nutzer nach ein bis zwei Wochen Experimentieren zusammenlaufen.

Wenn die Modellmathematik mehr ist, als Sie durchdenken wollen, oder Sie eine planbare Kostenlinie statt einer schwankenden API-Rechnung bevorzugen, spricht das für einen verwalteten Tarif mit gebündeltem Schlüssel. Die vollständige Aufschlüsselung finden Sie in wie viel kostet Hermes Agent wirklich.

Was Sie als Nächstes tun

Wenn Sie den kürzesten Weg wollen:

  1. Registrieren Sie sich bei OpenRouter und laden Sie ein kleines Guthaben auf.
  2. Setzen Sie model: deepseek/deepseek-v4-pro in Ihrer ~/.hermes/config.yaml.
  3. Fügen Sie einen Auxiliary-Model-Block für Kompression und Titel hinzu, der auf openai/gpt-4.1-nano zeigt.
  4. Lassen Sie Hermes eine Woche laufen und beobachten Sie das OpenRouter-Dashboard. Sie sehen, wie der Cache-Hit-Anteil beim Hauptmodell schnell steigt.

Wenn Sie die Konfigurationsdatei ganz überspringen wollen, starten Sie mit Hermify. Wir betreiben einen verwalteten Hermes Agent auf Telegram, Sie verbinden Ihren OpenRouter-Schlüssel und dasselbe DeepSeek-plus-Auxiliary-Muster ist der Standard. Sie konzentrieren sich auf das, was der Agent tut, nicht auf die Konfiguration, die ihn am Laufen hält.

Quellen

Betreiben Sie Ihren eigenen Hermes Agent

Bringen Sie Ihren API-Schlüssel mit, verbinden Sie Telegram und erhalten Sie in 60 Sekunden einen selbstlernenden KI-Agenten.

Loslegen