Zurück zum Blog
AI AgentsPricingSelf-hosting

Was kostet ein KI-Agent pro Monat in 2026?

Reale monatliche Kostenaufstellung für einen selbst gehosteten KI-Agenten in 2026: VPS, Modell-API, Sprache und wie Nutzungsstufen die Rechnung verändern.

Von Hermify Team||7 Min. Lesezeit
Dunkler, minimalistischer Schreibtisch mit Laptop, Kaffee und dem Text 'Monatskosten eines KI-Agenten'

Die ehrliche Antwort liegt bei 6 bis 80 Dollar pro Monat, und fast alles davon sind Modellkosten

Ein persönlicher KI-Agent, der rund um die Uhr auf einem kleinen VPS mit einem OpenRouter- oder Anthropic-Schlüssel läuft, liegt typischerweise zwischen 6 Dollar pro Monat am unteren Ende und 80 Dollar bei intensiver Nutzung. Die Infrastruktur ist auf dieser Rechnung fast ein Rundungsfehler: 4 bis 8 Dollar für einen kleinen VPS pro Monat, unabhängig davon, wie viel Sie mit dem Agenten sprechen. Alles über diesem Sockel sind Modellkosten, die mit der Anzahl der Tokens skalieren, die das Modell für Sie liest und schreibt.

Wenn Sie versucht haben, diese Zahl aus Rechnerseiten mit 200 bis 10.000 Dollar pro Monat rückwärts zu ermitteln: Die Verwirrung ist berechtigt. Diese Zahlen beschreiben Enterprise-Call-Center-Agenten, die Zehntausende Gespräche pro Monat abwickeln, nicht den Assistenten einer einzelnen Person auf Telegram. Dieser Beitrag ist die Aufschlüsselung für den zweiten Fall: ein Owner-Operator, ein Messaging-Kanal, die ehrliche Rechnung.

Warum sich die Rechnung in zwei Hälften teilt

Die monatlichen Kosten eines KI-Agenten sind die Summe aus zwei unabhängigen Posten:

  • Infrastruktur: ein kleiner Linux-Server, der online bleibt, den Gesprächszustand hält und das Messaging-Gateway betreibt. Fixkosten.
  • Modellkosten: Token-basierte Aufrufe beim Modellanbieter (OpenRouter, Anthropic, OpenAI). Variable Kosten, die mit der Nutzung skalieren.

Sie betreiben das Modell für einen persönlichen Agenten fast nie auf der eigenen Maschine. Lokale LLM-Inferenz braucht eine GPU oder 16 bis 32 GB RAM, was die Hardware-Rechnung über das treibt, was Sie bei realistischer persönlicher Nutzung im Pay-per-Token bezahlen würden. Der Rest dieses Artikels geht davon aus, dass das Modell bei einem Anbieter läuft und Ihr VPS lediglich mit ihm spricht.

Diese Trennung macht die Summe ehrlich abschätzbar. Der Infrastruktursockel ist im Voraus bekannt; die Modellkosten sind eine Funktion Ihrer Nachrichtenanzahl und Nachrichtenlänge.

Zeile 1: Der Infrastruktursockel

Ein API-gesteuerter Agent auf Telegram, Signal oder Slack braucht erstaunlich wenig Hardware. Die Mindestbasis liegt bei ein bis zwei vCPUs, 1 bis 2 GB RAM und 20 bis 40 GB SSD. Die meisten Runtimes, darunter Hermes Agent, laufen bequem in 2 GB RAM.

Reale monatliche Zahlen für 2026 für diese Ausstattung:

  • Hetzner CX22 (2 vCPU, 4 GB RAM, 40 GB NVMe): rund 3,79 Euro pro Monat in der EU, etwa 4,59 bis 4,99 Dollar in den US-Regionen. 20 TB Egress inklusive. Das ist die Standardempfehlung in Self-Hosting-Communities.
  • DigitalOcean Basic Droplet (1 vCPU, 1 GB RAM): 6 Dollar pro Monat, oder etwa 12 Dollar pro Monat für die 2-GB-Stufe. Vorhersehbare Preise und sauberere Dokumentation als bei Hetzner, dafür das Zwei- bis Vierfache für dieselbe Ausstattung.
  • Oracle Cloud Always Free ARM: 0 Dollar pro Monat, wenn Ihr Konto die Reclaim-Policy übersteht. Echter Free Tier, echte Reibung bei der Kontofreigabe.
  • Raspberry Pi 5 zu Hause: 80 Dollar einmalig plus 2 bis 4 Dollar pro Monat Strom für 24/7-Betrieb. Langfristig günstiger, bei instabilem Heiminternet weniger geeignet.

Für eine erste Schätzung sollten Sie 6 Dollar pro Monat als Infrastruktursockel ansetzen. Vom Hetzner CX22 bis zu einem kleinen DigitalOcean-Droplet liegt alles darin oder darunter. Wenn Sie die Abwägungen im Detail wollen, haben wir sie in Günstige VPS für KI-Agenten verglichen.

Zeile 2: Die Modellkosten

Hier weitet sich die Spanne. Modellanbieter berechnen pro Million Eingabetokens (was das Modell liest, inklusive der wachsenden Gesprächshistorie) und pro Million Ausgabetokens (was es zurückschreibt). Ein Token entspricht ungefähr 4 englischen Zeichen oder rund 0,75 Wörtern.

Die relevanten Tarife für einen persönlichen Agenten Mitte 2026:

  • Claude Haiku 4.5: 1,00 Dollar pro Million Eingabetokens, 5,00 Dollar pro Million Ausgabetokens. Das günstige Arbeitspferd für den Alltags-Chat.
  • GPT-4o: rund 2,50 Dollar pro Million Eingabetokens auf OpenRouter, 10 Dollar pro Million in der Ausgabe. Bewegt sich im selben Leistungsband wie Claude Sonnet.
  • Claude Sonnet 4.6: 3,00 Dollar pro Million Eingabe, 15 Dollar pro Million Ausgabe. Greifen Sie danach, wenn die Aufgabe tatsächlich mehr Denkleistung braucht.
  • Gemini Flash: ab 0,075 Dollar pro Million Eingabetokens auf OpenRouter. Die günstigste der Mainstream-Optionen, brauchbar als Fallback-Stufe.

Zwei Dinge sprengen den Rahmen dessen, was Einsteiger erwarten:

  1. Jede Nachricht spielt das gesamte Gespräch erneut ab. Das Modell hat kein eigenes Gedächtnis. Jede neue Nachricht wird so verarbeitet, als wären alle vorherigen Runden vorangestellt, sodass in Runde 10 eine einzige Antwort mit etwa dem Siebenfachen der Tokens von Runde 1 für dieselbe Ausgabe bepreist wird. Deshalb kann ein geschwätziger Agent, der Kontext nie beschneidet, teuer wirken, obwohl jede einzelne Nachricht kurz ist.
  2. Ausgabetokens kosten das 4- bis 5-Fache der Eingabetokens. Ein wortreiches Modell, das für eine Einzeiler-Frage lange Absätze schreibt, gibt für dieselbe Antwortqualität fünfmal so viel aus wie ein knappes.

Wie das in realen Monatsrechnungen aussieht

Angenommen 4 Zeichen pro Token, 750 Tokens für eine typische kurze Assistenzantwort und ein System-Prompt-Overhead im niedrigen dreistelligen Bereich. Gerundete, ehrliche Richtwerte für drei Nutzungsprofile mit Claude Haiku 4.5 oder einem vergleichbaren Modell mit Eingabepreis unter einem Dollar:

  • Leichte Nutzung (rund 20 Gespräche pro Tag, je 6 Runden): 3 bis 6 Millionen Tokens pro Monat. 5 bis 12 Dollar pro Monat an Modellkosten.
  • Mittlere Nutzung (rund 80 Gespräche pro Tag, je 8 Runden): 15 bis 25 Millionen Tokens pro Monat. 25 bis 50 Dollar pro Monat.
  • Intensive Nutzung (rund 200 Gespräche pro Tag, je 10 Runden, mit Sprachtranskription und TTS): 40 bis 80 Millionen Tokens pro Monat plus Audio. 60 bis 150 Dollar pro Monat.

Wechseln Sie für alles auf Claude Sonnet 4.6, verdreifachen sich diese Zahlen ungefähr. Wechseln Sie auf Gemini Flash, halbieren sie sich ungefähr. Die Modellwahl ist mit Abstand der größte Hebel auf die Gesamtsumme.

Optionale Zeile: Sprache

Wenn der Agent Sprachnachrichten entgegennimmt und in Sprache antwortet, wächst die Rechnung um zwei weitere variable Posten: STT (Speech-to-Text) für die Transkription des eingehenden Audios und TTS (Text-to-Speech) für die Synthese der Antwort. Zahlen zum Planen:

  • OpenAI Whisper API: 0,006 Dollar pro Minute eingehendem Audio. Eine Minute pro Tag liegt unter 0,20 Dollar im Monat; eine halbe Stunde pro Tag bei rund 5 Dollar im Monat.
  • ElevenLabs: nutzungsbasiert, startet bei 5 Dollar pro Monat im Starter-Plan; realer Produktionseinsatz landet je nach synthetisierten Zeichen bei 22 bis 99 Dollar pro Monat. Siehe ElevenLabs-Sprach-Setup für Hermes Agent für die Kompromisse.
  • Selbst gehostete Alternativen: Whisper.cpp, faster-whisper, Piper oder Edge TTS. Software-seitig kostenlos, dafür ein paar zusätzliche GB RAM in den VPS-Specs, wenn Sie diesen Weg wählen.

Für die meisten Owner-Operator addiert Sprache bei typischer Nutzung 10 bis 30 Dollar pro Monat auf ein reines Text-Setup.

Alles zusammen: Die drei Profile

Wenn wir das alles zusammenrechnen, sehen die ehrlichen Monatskosten eines persönlichen KI-Agenten im 24/7-Betrieb 2026 so aus:

  • Leicht (nur Text, günstiges Modell, kleiner VPS): 10 bis 20 Dollar pro Monat. Infrastruktur 6, Modell 5 bis 12, Sprache 0.
  • Mittel (Modell-Mix, gelegentlich Sprache, kleiner VPS): 40 bis 80 Dollar pro Monat. Infrastruktur 6, Modell 25 bis 50, Sprache 10 bis 25.
  • Intensiv (Modell der Sonnet-Klasse, tägliche Sprache, RAM-Reserve): 100 bis 200 Dollar pro Monat. Infrastruktur 12, Modell 60 bis 150, Sprache 20 bis 40.

Die Rechnung wird von der Modellwahl dominiert, nicht vom Hosting. Ein Nutzer, der von Sonnet-für-alles auf Haiku-für-Chat-und-Sonnet-für-harte-Fragen wechselt, kann seinen monatlichen Gesamtbetrag halbieren oder mehr, ohne die Denkleistung zu verlieren, die er wirklich braucht.

Die verborgene Zeile: Ihre Zeit

Die oben genannten selbst gehosteten Zahlen setzen voraus, dass der Agent von allein stehen bleibt. In der Praxis kostet der erste Monat meist einen Abend Einrichtung, und jedes Betriebssystem- oder Runtime-Upgrade eine weitere Stunde. Rate-Limits, abgelaufene API-Schlüssel oder ein Docker-Container, der jede Nacht leise neu startet (ein häufiges Problem, das wir in Hermes-Agent-Docker-Container startet ständig neu behandeln), kosten jeweils eigene Diagnosezeit.

Fair einpreisen lässt sich das über die Stundenkosten Ihrer Arbeit. Wenn das Bewachen eines selbst gehosteten Agenten Sie zwei Stunden pro Monat kostet und Ihre Zeit 50 Dollar die Stunde wert ist, dann sind das 100 Dollar pro Monat, die Sie sich selbst in Naturalien zahlen. Diese Zahl taucht selten in einer Tabelle auf, ist aber der Grund, warum die meisten Owner-Operator irgendwann auf eine verwaltete Option umsteigen.

Die verwaltete Alternative

Wenn Sie den VPS nicht selbst betreiben, das OpenRouter-Konto nicht selbst pflegen oder nichts davon nachhalten möchten: Hermify betreibt einen verwalteten Hermes Agent auf Telegram mit persistentem Speicher, der bei Ihnen bleibt. In der Einstiegsstufe bringen Sie Ihren eigenen Modellschlüssel mit (BYOK), sodass die Modellkosten weiter auf Ihrer Rechnung erscheinen und in Ihrer Kontrolle bleiben, die Infrastrukturzeile jedoch komplett verschwindet. Für Leser, die Kosten gezielt gegen ein markenbezogenes Äquivalent stellen, haben wir unsere eigenen Stufen in Was kostet Hermes Agent aufgeschlüsselt.

Dieser Kompromiss ist die ehrliche Schlussfolgerung jedes Artikels über Monatskosten: Der reine Infrastruktursockel eines selbst gehosteten Agenten ist günstig, die Modellkosten sind auf beiden Wegen gleich, und die verborgene Variable ist, wie viel Ihrer Aufmerksamkeit das Setup verschlingt. Rechnen Sie alle drei Zeilen durch, bevor Sie entscheiden.

Sources

Betreiben Sie Ihren eigenen Hermes Agent

Bringen Sie Ihren API-Schlüssel mit, verbinden Sie Telegram und erhalten Sie in 60 Sekunden einen selbstlernenden KI-Agenten.

Loslegen