Torna al blog
HermesAI AgentsModels

Hermes 4 vs Hermes 3: cosa cambia e quale scegliere

Un confronto concreto tra le famiglie Hermes 4 e Hermes 3 di Nous Research, con una guida per scegliere quale far girare in Hermes Agent BYOK.

Di Hermify Team||7 min di lettura
Grafica a schermo diviso che contrappone un wordmark di Hermes 3 a uno di Hermes 4 su sfondo scuro, separati da una sottile linea verde

Cosa è cambiato tra Hermes 3 e Hermes 4

Hermes 3, pubblicato da Nous Research nel 2024, era una famiglia di fine-tune completi di Llama 3.1 nei tagli 8B, 70B e 405B. La linea guida era allineamento neutro e capacità di essere direzionato: un assistente potente e non censurato che faceva ciò che chiedevi senza aggiungere opinioni proprie. Non ragionava passo passo di default. Rispondeva.

Hermes 4, pubblicato ad agosto 2025, è un altro animale. Arriva in tre tagli (14B su Qwen 3, 70B e 405B su Llama 3.1) e aggiunge una modalità di ragionamento ibrido in cui il modello sceglie se pensare in tracce <think>...</think> prima di rispondere. Il corpus di post-training è cresciuto di circa cinquanta volte: da circa 1M di esempi e 1,2B di token in Hermes 3 a circa 5M di esempi e 60B di token in Hermes 4, mescolando dati con e senza ragionamento. L'addestramento ha girato su 192 GPU NVIDIA B200.

Poi, a dicembre 2025, Nous ha pubblicato Hermes 4.3 36B. Si basa sull'architettura Seed-OSS-36B di ByteDance, estende il contesto a 512K token ed è stato post-addestrato interamente sulla rete decentralizzata Psyche di Nous. Sfiora le prestazioni di Hermes 4 70B nelle valutazioni con la metà dei parametri.

Se fai girare Hermes Agent con la tua chiave OpenRouter o direttamente Nous, la scelta del modello è finalmente interessante. Ecco cosa cambia davvero e come scegliere.

La famiglia Hermes 4 in sintesi

Modello Base Modalità ragionamento Ideale per
Hermes 4 14B Qwen 3 14B Inferenza locale, dispositivi edge, bozze a basso costo
Hermes 4 70B Llama 3.1 70B Carichi BYOK attenti al costo che richiedono qualità reale
Hermes 4 405B Llama 3.1 405B Ragionamento di frontiera: matematica, codice, STEM difficile
Hermes 4.3 36B Seed-OSS 36B Lavoro con contesto da 512K, self-hosting locale su una GPU

Tutti e quattro condividono lo stesso trucco del ragionamento ibrido: un solo set di pesi, un solo interruttore. Non devi mantenere un modello "ragionamento" e un modello "instruct" separati.

Ragionamento ibrido: la funzionalità che conta di più

Su Hermes 3 ricevevi una risposta diretta. Veloce, competente, chiusa.

Su Hermes 4 puoi chiedere entrambi i comportamenti sullo stesso checkpoint. In modalità ragionamento il modello emette un blocco <think>...</think> con la deliberazione interna e poi la risposta finale. Con la modalità disattivata risponde diretto, come faceva Hermes 3.

Due conseguenze per il tuo uso dentro Hermes Agent:

  • Non ti servono due slot di provider. Punta il BYOK a un singolo modello Hermes 4 e cambia modalità per compito tramite system prompt o convenzione del wrapper. Più economico e più semplice di far viaggiare il traffico tra modelli separati.
  • Paghi per i token spesi a pensare. La modalità ragionamento non è gratis. Un blocco <think> lungo può facilmente raddoppiare il costo di output di una domanda difficile: tienilo spento per riassunti di routine o conversazione informale.

Se vuoi capire meglio come si comporta un agente con ragionamento nel giorno per giorno, il nostro articolo su memoria e skill di Hermes Agent mostra come i file di memoria cambiano ciò su cui l'agente sceglie di ragionare.

Benchmark: cosa dicono davvero i numeri

In cima allo stack, Hermes 4 405B in modalità ragionamento riporta:

  • MATH-500: 96,3
  • AIME'24: 81,9
  • GPQA Diamond: 70,5
  • LiveCodeBench: 61,3

Sono numeri competitivi con DeepSeek R1 671B e Qwen 3 235B, su pesi aperti. Il titolo del 96,3 su MATH-500 è reale, ma trattalo come un tetto per un certo tipo di domanda, non come una promessa su ogni prompt: sui task senza ragionamento lo stesso modello si comporta più come un forte Llama 3.1 405B ben rifinito che come un raziocinatore di frontiera.

Hermes 4 70B perde qualche punto sui benchmark di ragionamento più duri in cambio di un'inferenza circa sei volte più economica. Hermes 4 14B è il modello sottovalutato: abbastanza piccolo da girare su una singola GPU consumer e mantiene il ragionamento ibrido, cosa insolita a quel taglio.

Hermes 4.3 36B è il più interessante da tenere d'occhio. Nous riporta che sfiora Hermes 4 70B con la metà dei parametri, grazie alla base Seed-OSS più grande e al post-training distribuito su Psyche. Ha anche 512K di contesto, cosa che il 70B non offre.

Quale far girare in Hermes Agent

Hermes Agent è agnostico rispetto al modello. Scegli nel config.yaml o tramite la configurazione OpenRouter di Hermes Agent, e l'harness pensa al resto. Regola pratica per chi usa BYOK:

  • Riassunti di contesti lunghi, memoria di chat estesa, code review su file grossi. Scegli Hermes 4.3 36B. La finestra da 512K è il fattore decisivo. Nient'altro nella famiglia compete lì.
  • Ragionamento difficile: matematica, codice nuovo, planning agentico a molti passi. Scegli Hermes 4 405B in modalità ragionamento. Spegnila sui turni di routine e riaccendila su quelli tosti.
  • Modello quotidiano attento al costo. Scegli Hermes 4 70B. È l'equilibrio di default. Buone risposte, prezzo ragionevole, e porta comunque il ragionamento ibrido se ti serve.
  • Edge, locale o esecuzioni offline. Scegli Hermes 4 14B, oppure Hermes 4.3 36B se hai una GPU più muscolosa. I GGUF da 14B girano comodi su una singola scheda di fascia media.
  • Hai un Hermes 3 già in produzione che copre il tuo caso. Non migrare per il gusto di farlo. Hermes 3 405B è ancora un assistente forte senza ragionamento. Cambia solo quando ti serve una delle quattro capacità qui sopra.

Per una visione più ampia sulla scelta del livello di provider, guarda il nostro confronto hosting vs self-hosting di Hermes Agent. La scelta del modello è in gran parte ortogonale a dove esegui l'agente.

Come cambiare modello in Hermes Agent

Il cambio è una modifica di config, non una ricostruzione. In ~/.hermes/config.yaml:

model:
  provider: openrouter
  name: nousresearch/hermes-4-405b
  # Per accesso diretto a Nous, usa:
  # provider: nous
  # name: hermes-4-405b

Riavvia il gateway:

hermes gateway restart

Per la modalità ragionamento, la maggior parte dei modelli Hermes 4 accetta un flag reasoning: true o enable_thinking: true lato provider, oppure puoi avvolgere il prompt con una direttiva <think> esplicita a livello di system prompt. Controlla la documentazione del tuo provider prima di dare per scontati i default.

Se usi BYOK tramite un host gestito, il cambio è ancora più semplice: modifica la stringa del modello nella tua dashboard e invia un nuovo messaggio. Nessun riavvio, nessuna ricostruzione dell'immagine.

In sintesi

Da Hermes 3 a Hermes 4 il salto è più grande di quanto suggerisca il numero di versione. Passi da un forte fine-tune di Llama 3.1 con buona pilotabilità a una famiglia con ragionamento ibrido, benchmark di frontiera competitivi, una pipeline di addestramento distribuita (4.3) e una vera opzione a contesto lungo. La migrazione è un cambio di config se già usi Hermes Agent, e il ROI è più alto sui carichi che coinvolgono ragionamento reale, contesto lungo o entrambe le cose.

Scegli il modello più piccolo della famiglia che risponde bene alla tua domanda più difficile. Attiva il ragionamento solo quando serve. E tieni d'occhio i rilasci sulla rete Psyche: lo schema di 4.3 (base più piccola, più post-training, run decentralizzato) è quasi certamente la forma dei prossimi Hermes.

Inizia con Hermify se vuoi che il cambio di modello sia un menu a tendina invece di un file di configurazione, con un Hermes Agent già in esecuzione su Telegram mentre decidi.

Fonti

Avvia il tuo Hermes Agent

Porta la tua chiave API, collega Telegram e ottieni un agente IA che migliora da solo, online in 60 secondi.

Inizia ora