Modello OpenRouter più economico per Hermes Agent nel 2026
La short list dei modelli OpenRouter sotto 1 dollaro per milione di token nel 2026, classificati sui carichi reali di tool calling e costo mensile.
La Domanda Dietro la Domanda
Se hai già scelto OpenRouter come provider, la cosa successiva che vuoi sapere non è "qual è il miglior modello". È "qual è il più economico che regge ancora bene i carichi di Hermes Agent". È una domanda più stretta, e nel 2026 ha una risposta molto più chiara rispetto a un anno fa.
Hermes Agent è un runtime pesante di strumenti. A ogni turno passa al modello un system prompt, una lunga lista di definizioni di tool, la cronologia recente della chat e i file che ha aperto. L'output di solito è piccolo: una risposta breve e una o due chiamate di tool. Questa forma pesante in input è ciò che rende così utili i modelli con sconto sulla cache, e per questo "più economico" qui significa "più economico dato come Hermes parla al modello", non il prezzo di listino più basso in una pagina di marketing.
La Short List Sotto 1 Dollaro per Milione di Token
Ecco i modelli disponibili su OpenRouter a luglio 2026 che restano sotto 1 dollaro per milione di token sia in input che in output. I prezzi sono quelli che OpenRouter ribalta dal provider a monte. Un modello tecnicamente più economico che però non segue bene gli schemi dei tool o perde chiamate di funzione sotto carico non entra in questa lista, perché una chiamata di tool rotta in Hermes Agent significa che l'intero turno spreca token e va rifatto.
| Modello | Input $/M | Output $/M | Sconto cache | Note |
|---|---|---|---|---|
| DeepSeek V4-Pro | 0,435 | 0,87 | Fino a ~99% (cache hit a 0,003625 $/M) | Ottimo tool calling, contesto 1M, pesi aperti |
| DeepSeek V4-Flash | 0,14 | 0,28 | Cache hit a 0,0028 $/M in input | Variante più rapida di DeepSeek, buona per i task ausiliari |
| GPT-4.1 Nano | 0,10 | 0,40 | Prompt caching lato OpenAI upstream | Il più debole del gruppo nel seguire i tool |
| Gemini 2.5 Flash Lite | 0,10 | 0,40 | Nessuno sconto cache esplicito | Rapido, tool calling accettabile |
| Llama 4 Scout (Groq / DeepInfra) | 0,08 - 0,11 | 0,30 - 0,34 | Nessuno sconto cache | Latenza più bassa e free tier generoso per i test |
Due cose contano più dei prezzi di listino quando fai girare Hermes Agent su questi modelli.
Primo, Hermes invia quasi ad ogni turno le stesse definizioni di tool. È esattamente il pattern per cui esiste una cache KV. Su DeepSeek V4-Pro, un cache hit costa 0,003625 $ per milione di token in input, circa 120x in meno di un miss. Lungo una vera settimana d'uso di Hermes, i token in cache hit dominano e il costo effettivo per turno scende ben sotto il numero della copertina.
Secondo, se un modello restituisce chiamate di tool malformate sotto carico, Hermes riprova. Ogni retry è un nuovo turno di input completo. Un modello del 20% più economico che sbaglia il 10% delle chiamate finisce per costare più del modello "meno economico" che le prende al primo colpo. È per questo che DeepSeek V4-Pro sta in cima anche se qualche modello ha prezzi di listino più bassi.
La Ricetta che la Maggior Parte Vuole Davvero
Il pattern più comune nella community OpenRouter per un deployment low-cost di Hermes è uno split a due modelli. Punti Hermes su un modello più forte per il ciclo di ragionamento principale e instradi i task ausiliari - compressione del contesto, titoli delle chat, vision-to-text, riepilogo della sessione - verso qualcosa di più economico.
Nel tuo ~/.hermes/config.yaml, si presenta più o meno così:
provider: openrouter
model: deepseek/deepseek-v4-pro
openrouter_api_key: sk-or-your-key-here
auxiliary_model:
compression: openai/gpt-4.1-nano
title_generation: openai/gpt-4.1-nano
vision: google/gemini-2.5-flash-lite
web_summary: openai/gpt-4.1-nano
Il modello principale si prende il ragionamento duro e le chiamate di tool. Il modello ausiliario si occupa di ciò che Hermes fa in background, molto più tollerante verso un modello più debole. Insieme coprono circa il 95% delle interazioni al livello più economico possibile.
Se preferisci prima il setup completo di OpenRouter, leggi Come configurare Hermes Agent con OpenRouter. Questo post presuppone che tu abbia già una chiave OpenRouter e stia scegliendo un modello.
Dove i Modelli Economici Cedono
Il trade-off onesto a questa fascia di prezzo è che i modelli sotto 1 dollaro sono forti nei carichi ripetitivi guidati da skill e più deboli sul ragionamento nuovo e difficile. Il pane quotidiano di Hermes Agent - digest schedulati via cron, riepiloghi di RSS, scritture in memoria, "ricordamelo domani", triage su Telegram - è proprio ciò che i modelli economici reggono bene.
Dove i modelli economici crollano:
- Sessioni di debugging lunghe e multi-passo, dove il modello deve tenere molto stato e rivedere il piano
- Redazione legale o medica che punisce anche un piccolo errore di fatto
- Code review su diff non banali, dove contano sfumature semantiche sottili
- Qualsiasi task in cui essere al 90% è peggio che essere al 100%
Per quei casi, la risposta non è "compra un modello economico più grosso", è "instrada per task". Tieni DeepSeek V4-Pro (o un simile sotto 1 dollaro) come default. Configura un fallback su Claude Sonnet o GPT-4o per le skill specifiche che lo richiedono. Paghi prezzi da frontier sulla piccola quota di turni che vogliono qualità da frontier e prezzi economici sul 95% che non ne ha bisogno.
Il post miglior provider di modelli per Hermes Agent approfondisce il trade-off a livello di provider. Questo post è di un livello più stretto: dato che hai già scelto OpenRouter, verso quale modello specifico instradare.
Cosa Significa per la tua Bolletta Mensile
Se stai self-hosting Hermes e paghi il modello direttamente su OpenRouter, la fascia sotto 1 dollaro è ciò che tiene la bolletta mensile davvero piccola. Un utente quotidiano con qualche cron e una dozzina di scambi al giorno, con DeepSeek V4-Pro e i cache hit che funzionano, di solito atterra in una fascia bassa, di pochi dollari al mese. Un uso pesante della modalità vocale o dello scraping web alza la cifra, ma non di un ordine di grandezza.
Se sei sul piano Starter di Hermify, la spesa del modello è BYOK (porta la tua chiave) su OpenRouter, quindi la scelta qui sopra determina letteralmente la tua bolletta mensile. Scegliere DeepSeek V4-Pro come modello principale e un nano per i task ausiliari è ciò su cui la maggior parte degli utenti Starter converge dopo una settimana o due di prove.
Se tutta questa matematica dei modelli è più di quanto ti va di considerare, o vuoi una singola voce di costo prevedibile invece di una bolletta API variabile, allora ha senso un piano gestito con chiave inclusa. La scomposizione completa è in quanto costa davvero Hermes Agent.
Cosa Fare Adesso
Se vuoi la strada più breve:
- Registrati su OpenRouter e aggiungi un piccolo credito.
- Imposta
model: deepseek/deepseek-v4-pronel tuo~/.hermes/config.yaml. - Aggiungi un blocco auxiliary_model per compressione e titoli che punta a
openai/gpt-4.1-nano. - Fai girare Hermes per una settimana e guarda la dashboard di OpenRouter. Vedrai la quota di cache hit salire in fretta sul modello principale.
Se vuoi saltare del tutto il file di configurazione, inizia con Hermify. Facciamo girare un Hermes Agent gestito su Telegram, tu colleghi la tua chiave OpenRouter e lo stesso schema DeepSeek + ausiliario è il default. Ti concentri su cosa fa l'agente, non sulla configurazione che lo tiene in piedi.
Fonti
- Lowest-Cost LLM Inference: The Complete OpenRouter Guide
- Hermes Agent + OpenRouter: Setup, Model Choice & Routing Config
- DeepSeek API Pricing 2026: V4-Flash & V4-Pro Per-Token Costs
- DeepSeek V4: 1.6T MoE, 1M Context, $0.87/M Output
- Configuring Models - Hermes Agent, Nous Research
- AI Model Pricing Comparison 2026
Avvia il tuo Hermes Agent
Porta la tua chiave API, collega Telegram e ottieni un agente IA che migliora da solo, online in 60 secondi.
Inizia ora