Modèle OpenRouter le moins cher pour Hermes Agent en 2026
La short list des modèles OpenRouter sous 1 dollar par million de tokens en 2026, classés selon les charges tool-calling réelles et le coût mensuel.
La Question Derrière la Question
Si vous avez déjà choisi OpenRouter comme fournisseur, la question suivante n'est pas "quel est le meilleur modèle". C'est "quel est le moins cher qui gère encore bien les charges de Hermes Agent". C'est une question plus étroite, et en 2026 elle a une réponse beaucoup plus claire qu'il y a un an.
Hermes Agent est un runtime chargé en outils. À chaque tour, il envoie au modèle un system prompt, une longue liste de définitions d'outils, l'historique récent du chat et les fichiers ouverts. La sortie est en général courte, une réponse brève et un ou deux appels d'outils. Cette forme lourde en entrée est ce qui rend les modèles avec remise de cache si utiles, et c'est pourquoi "moins cher" ici signifie "moins cher compte tenu de la façon dont Hermes parle au modèle", pas le plus petit prix affiché sur une page marketing.
La Short List Sous 1 Dollar par Million de Tokens
Voici les modèles disponibles sur OpenRouter en juillet 2026 qui passent sous 1 dollar par million de tokens, à l'entrée comme à la sortie. Les prix sont ceux qu'OpenRouter répercute depuis le fournisseur source. Un modèle techniquement moins cher mais qui ne respecte pas bien les schémas d'outils ou qui perd des appels de fonction sous charge n'est pas dans cette liste, parce qu'un appel d'outil cassé dans Hermes Agent signifie que le tour entier gaspille des tokens et doit être rejoué.
| Modèle | Entrée $/M | Sortie $/M | Remise cache | Notes |
|---|---|---|---|---|
| DeepSeek V4-Pro | 0,435 | 0,87 | Jusqu'à ~99% (cache hit à 0,003625 $/M) | Bon tool calling, contexte de 1M, poids ouverts |
| DeepSeek V4-Flash | 0,14 | 0,28 | Cache hit à 0,0028 $/M d'entrée | Variante la plus rapide de DeepSeek, bonne pour les tâches auxiliaires |
| GPT-4.1 Nano | 0,10 | 0,40 | Prompt caching côté OpenAI upstream | Le moins bon du groupe pour suivre les outils |
| Gemini 2.5 Flash Lite | 0,10 | 0,40 | Pas de remise cache explicite | Rapide, tool calling tolérable |
| Llama 4 Scout (Groq / DeepInfra) | 0,08 - 0,11 | 0,30 - 0,34 | Pas de remise cache | Latence la plus faible et palier gratuit généreux pour les tests |
Deux choses comptent plus que les prix affichés quand vous faites tourner Hermes Agent contre ces modèles.
D'abord, Hermes envoie les mêmes définitions d'outils à presque chaque tour. C'est exactement le motif pour lequel un cache KV existe. Sur DeepSeek V4-Pro, un cache hit coûte 0,003625 $ par million de tokens en entrée, soit environ 120x moins qu'un miss. Sur une vraie semaine d'usage de Hermes, les tokens en cache hit dominent et le coût effectif par tour tombe très en dessous du chiffre affiché.
Ensuite, si un modèle renvoie des appels d'outils mal formés sous charge, Hermes réessaie. Chaque retry est un nouveau tour d'entrée complet. Un modèle 20% moins cher qui rate 10% des appels finit plus cher que le modèle "plus cher" qui réussit du premier coup. C'est pour cela que DeepSeek V4-Pro est en tête même quand quelques modèles ont un prix affiché plus bas.
La Recette que la Plupart des Gens Veulent Vraiment
Le motif le plus courant dans la communauté OpenRouter pour un déploiement Hermes à bas coût est un split de deux modèles. Vous pointez Hermes vers un modèle plus fort pour la boucle de raisonnement principale et vous routez les tâches auxiliaires - compression de contexte, titres de chat, vision-vers-texte, résumé de session - vers quelque chose de moins cher.
Dans votre ~/.hermes/config.yaml, cela ressemble à peu près à ceci :
provider: openrouter
model: deepseek/deepseek-v4-pro
openrouter_api_key: sk-or-your-key-here
auxiliary_model:
compression: openai/gpt-4.1-nano
title_generation: openai/gpt-4.1-nano
vision: google/gemini-2.5-flash-lite
web_summary: openai/gpt-4.1-nano
Le modèle principal prend le raisonnement dur et les appels d'outils. Le modèle auxiliaire gère les tâches que Hermes exécute en arrière-plan, bien plus indulgentes avec un modèle plus faible. Ensemble, cela couvre environ 95% des interactions au tarif le plus bas possible.
Si vous voulez d'abord le setup OpenRouter de bout en bout, lisez Comment configurer Hermes Agent avec OpenRouter. Ce post suppose que vous avez déjà une clé OpenRouter et que vous choisissez un modèle.
Là où les Modèles Moins Chers Coincent
Le vrai compromis à ce tarif est que les modèles sub-1$ sont forts sur les charges répétitives pilotées par des skills et plus faibles sur du raisonnement neuf et difficile. Le quotidien d'Hermes Agent - digests planifiés par cron, résumés RSS, écritures en mémoire, "rappelle-le-moi demain", triage sur Telegram - est justement là où les modèles moins chers tiennent bien.
Là où les modèles moins chers coincent :
- Débogage long en plusieurs étapes où le modèle doit tenir beaucoup d'état et réviser un plan
- Rédaction juridique ou médicale qui punit la moindre erreur factuelle
- Revue de code sur des diffs non triviaux où les nuances sémantiques comptent
- Toute tâche où être à 90% correct est pire qu'être à 100%
Pour ces cas-là, la réponse n'est pas "acheter un modèle bon marché plus gros", c'est "router par tâche". Gardez DeepSeek V4-Pro (ou un autre sub-1$ similaire) comme choix par défaut. Configurez un fallback vers Claude Sonnet ou GPT-4o pour les skills spécifiques qui en ont besoin. Vous payez le prix fort sur la petite part de tours qui exigent une qualité de pointe et le prix bas sur les 95% qui ne l'exigent pas.
Le post meilleur fournisseur de modèles pour Hermes Agent creuse le compromis au niveau du fournisseur. Ce post est un cran plus étroit : puisque vous avez choisi OpenRouter, vers quel modèle précis router.
Ce que Cela Change à votre Facture Mensuelle
Si vous auto-hébergez Hermes et que vous payez le modèle directement sur OpenRouter, la tranche sub-1$ est ce qui garde la facture mensuelle réellement basse. Un utilisateur quotidien avec quelques crons et une douzaine d'échanges par jour, sur DeepSeek V4-Pro avec les cache hits qui fonctionnent, atterrit en général dans une fourchette basse de quelques dollars par mois. Un usage intensif de la voix ou du scraping web fait monter la note, mais pas d'un ordre de grandeur.
Si vous êtes sur le plan Starter de Hermify, la dépense modèle est bring-your-own-key sur OpenRouter, donc le choix ci-dessus détermine littéralement votre facture mensuelle. Choisir DeepSeek V4-Pro comme modèle principal et un nano pour les tâches auxiliaires, c'est ce que la plupart des utilisateurs Starter finissent par adopter après une semaine ou deux d'expérimentation.
Si toute cette arithmétique de modèles est plus que ce que vous voulez gérer, ou si vous préférez une ligne de coût prévisible plutôt qu'une facture d'API variable, c'est le moment d'un plan géré avec clé incluse. Le décryptage complet est dans combien coûte vraiment Hermes Agent.
Que Faire Maintenant
Si vous voulez le chemin le plus court :
- Inscrivez-vous sur OpenRouter et ajoutez un petit crédit.
- Mettez
model: deepseek/deepseek-v4-prodans votre~/.hermes/config.yaml. - Ajoutez un bloc auxiliary_model pour la compression et les titres pointant vers
openai/gpt-4.1-nano. - Faites tourner Hermes pendant une semaine et surveillez le dashboard OpenRouter. Vous verrez la part de cache hits monter vite sur le modèle principal.
Si vous voulez éviter le fichier de config, commencez avec Hermify. On fait tourner un Hermes Agent géré sur Telegram, vous branchez votre clé OpenRouter et le même schéma DeepSeek + auxiliaire est le défaut. Vous vous concentrez sur ce que fait l'agent, pas sur la config qui le tient debout.
Sources
- Lowest-Cost LLM Inference: The Complete OpenRouter Guide
- Hermes Agent + OpenRouter: Setup, Model Choice & Routing Config
- DeepSeek API Pricing 2026: V4-Flash & V4-Pro Per-Token Costs
- DeepSeek V4: 1.6T MoE, 1M Context, $0.87/M Output
- Configuring Models - Hermes Agent, Nous Research
- AI Model Pricing Comparison 2026
Lancez votre propre agent Hermes
Apportez votre clé API, connectez Telegram et obtenez un agent IA auto-améliorant opérationnel en 60 secondes.
Commencer