Retour au blog
HermesAI AgentsModels

Hermes 4 vs Hermes 3 : ce qui change et lequel choisir

Comparaison concrète des familles Hermes 4 et Hermes 3 de Nous Research, avec un guide pour choisir laquelle utiliser dans Hermes Agent BYOK.

Par Hermify Team||7 min de lecture
Graphique en écran divisé contrastant un wordmark Hermes 3 avec un wordmark Hermes 4 sur fond sombre, séparés par une fine ligne verte

Ce qui a changé entre Hermes 3 et Hermes 4

Hermes 3, publié par Nous Research en 2024, était une famille de fine-tunes complets de Llama 3.1 en 8B, 70B et 405B. Son parti pris : un alignement neutre et une réelle capacité de pilotage, un assistant puissant et non censuré qui faisait ce qu'on lui demandait sans ajouter d'opinion personnelle. Il ne raisonnait pas pas à pas par défaut. Il répondait.

Hermes 4, publié en août 2025, est un autre animal. Il arrive en trois tailles (14B sur Qwen 3, 70B et 405B sur Llama 3.1) et ajoute un mode de raisonnement hybride où le modèle choisit de réfléchir dans des traces <think>...</think> avant de répondre. Le corpus de post-entraînement a été multiplié par environ cinquante : de l'ordre de 1M d'échantillons et 1,2B de tokens pour Hermes 3 à environ 5M d'échantillons et 60B de tokens pour Hermes 4, mêlant données avec et sans raisonnement. L'entraînement a tourné sur 192 GPU NVIDIA B200.

Puis, en décembre 2025, Nous a publié Hermes 4.3 36B. Il repose sur l'architecture Seed-OSS-36B de ByteDance, étend le contexte à 512K tokens et a été post-entraîné intégralement sur le réseau décentralisé Psyche de Nous. Il égale presque Hermes 4 70B en évaluation avec la moitié des paramètres.

Si vous faites tourner Hermes Agent avec votre propre clé OpenRouter ou en direct chez Nous, le choix du modèle est enfin réellement intéressant. Voici ce qui change et comment choisir.

La famille Hermes 4 en un coup d'œil

Modèle Base Mode raisonnement Idéal pour
Hermes 4 14B Qwen 3 14B Oui Inférence locale, edge, brouillons peu coûteux
Hermes 4 70B Llama 3.1 70B Oui Charges BYOK à coût maîtrisé nécessitant une vraie qualité
Hermes 4 405B Llama 3.1 405B Oui Raisonnement de pointe : maths, code, STEM difficile
Hermes 4.3 36B Seed-OSS 36B Oui Contexte de 512K, auto-hébergement local sur un seul GPU

Les quatre partagent la même astuce de raisonnement hybride : un seul jeu de poids, un interrupteur. Pas besoin de maintenir un modèle « raisonnement » séparé et un modèle « instruct ».

Le raisonnement hybride : la fonctionnalité qui compte le plus

Sur Hermes 3, vous obteniez une réponse directe. Rapide, compétente, terminée.

Sur Hermes 4, vous pouvez demander l'un ou l'autre comportement sur le même checkpoint. En mode raisonnement, le modèle émet un bloc <think>...</think> contenant sa délibération interne, puis une réponse finale. En mode direct, il répond immédiatement, comme Hermes 3.

Deux implications pour votre usage dans Hermes Agent :

  • Vous n'avez pas besoin de deux slots de fournisseur. Pointez BYOK vers un seul modèle Hermes 4 et changez de mode par tâche via system prompt ou convention de wrapper. Moins cher et plus simple que de router entre modèles de raisonnement et non-raisonnement séparés.
  • Vous payez les tokens que le modèle a consacrés à réfléchir. Le mode raisonnement n'est pas gratuit. Un long bloc <think> peut facilement doubler le coût de sortie d'une question difficile ; laissez-le désactivé pour les résumés de routine ou la conversation informelle.

Pour voir plus concrètement comment un agent avec raisonnement se comporte au quotidien, notre article sur la mémoire et les skills de Hermes Agent montre comment les fichiers de mémoire modifient ce sur quoi l'agent choisit de raisonner.

Benchmarks : ce que disent vraiment les chiffres

Tout en haut, Hermes 4 405B en mode raisonnement rapporte :

  • MATH-500 : 96,3
  • AIME'24 : 81,9
  • GPQA Diamond : 70,5
  • LiveCodeBench : 61,3

Ces chiffres sont compétitifs avec DeepSeek R1 671B et Qwen 3 235B, en poids ouverts. Le titre du 96,3 sur MATH-500 est réel, mais traitez-le comme un plafond pour un certain type de question, pas comme une promesse valable sur n'importe quel prompt : sur les tâches sans raisonnement, le même modèle se comporte davantage comme un Llama 3.1 405B bien ajusté que comme un raisonneur de frontière.

Hermes 4 70B perd quelques points sur les benchmarks de raisonnement les plus durs en échange d'une inférence environ six fois moins chère. Hermes 4 14B est l'outsider : assez petit pour tourner sur un seul GPU grand public tout en conservant le raisonnement hybride, ce qui est rare à cette taille.

Hermes 4.3 36B est le plus intéressant à surveiller. Nous rapporte qu'il égale presque Hermes 4 70B avec la moitié des paramètres, grâce à la base Seed-OSS plus grande et au post-entraînement distribué sur Psyche. Il offre en plus une fenêtre de contexte de 512K, absente du 70B.

Lequel faire tourner dans Hermes Agent

Hermes Agent est agnostique au modèle. Vous choisissez dans votre config.yaml ou via la configuration d'OpenRouter dans Hermes Agent, et le harnais s'occupe du reste. Règle du pouce pour les utilisateurs BYOK :

  • Résumé de long contexte, mémoire de chat étendue, revue de code sur gros fichiers. Choisissez Hermes 4.3 36B. La fenêtre de 512K est le facteur décisif. Rien d'autre dans la famille ne rivalise là-dessus.
  • Raisonnement difficile : maths, code inédit, planification agentique multi-étapes. Choisissez Hermes 4 405B en mode raisonnement. Coupez-le sur les tours de routine et rallumez-le sur les tours difficiles.
  • Modèle du quotidien à coût maîtrisé. Choisissez Hermes 4 70B. C'est l'équilibre par défaut. De bonnes réponses, un prix raisonnable, et toujours le raisonnement hybride si besoin.
  • Edge, local ou exécutions hors ligne. Choisissez Hermes 4 14B, ou Hermes 4.3 36B si vous avez une GPU plus musclée. Les GGUFs 14B tournent confortablement sur une carte milieu de gamme.
  • Vous avez un Hermes 3 opérationnel et il couvre vos besoins. Ne migrez pas pour migrer. Hermes 3 405B reste un assistant solide sans raisonnement. Changez uniquement quand vous avez besoin de l'une des quatre capacités ci-dessus.

Pour une vision plus large du choix de la couche fournisseur, voyez notre comparatif hébergement vs auto-hébergement de Hermes Agent. Le choix du modèle est en grande partie indépendant de l'endroit où vous faites tourner l'agent.

Comment changer de modèle dans Hermes Agent

Le changement est un ajustement de config, pas un rebuild. Dans ~/.hermes/config.yaml :

model:
  provider: openrouter
  name: nousresearch/hermes-4-405b
  # Pour un accès direct à Nous, utilisez :
  # provider: nous
  # name: hermes-4-405b

Redémarrez la passerelle :

hermes gateway restart

Pour le mode raisonnement, la plupart des modèles Hermes 4 acceptent un flag reasoning: true ou enable_thinking: true côté fournisseur, ou vous pouvez encapsuler votre prompt avec une directive <think> explicite au niveau du system prompt. Vérifiez la documentation de votre fournisseur avant de supposer un comportement par défaut.

Si vous utilisez BYOK via un hébergeur managé, le changement est encore plus simple : modifiez la chaîne du modèle dans votre tableau de bord et envoyez un nouveau message. Aucun redémarrage, aucun rebuild d'image.

Pour conclure

De Hermes 3 à Hermes 4, le saut est plus grand que ne le suggère le numéro de version. Vous passez d'un solide fine-tune de Llama 3.1 avec bonne pilotabilité à une famille dotée de raisonnement hybride, de benchmarks de pointe compétitifs, d'un pipeline d'entraînement distribué (4.3) et d'une véritable option de long contexte. La migration est un simple changement de config si vous utilisez déjà Hermes Agent, et le ROI est le plus élevé pour les charges qui impliquent du vrai raisonnement, du long contexte ou les deux.

Choisissez le plus petit modèle de la famille qui répond bien à votre question la plus difficile. Activez le raisonnement uniquement quand c'est nécessaire. Et gardez un œil sur les publications du réseau Psyche : le schéma 4.3 (base plus petite, post-entraînement plus important, run décentralisé) est très probablement la forme des prochains Hermes.

Commencez avec Hermify si vous préférez que le changement de modèle soit un menu déroulant plutôt qu'un fichier de configuration, avec un Hermes Agent qui tourne sur Telegram pendant que vous vous décidez.

Sources

Lancez votre propre agent Hermes

Apportez votre clé API, connectez Telegram et obtenez un agent IA auto-améliorant opérationnel en 60 secondes.

Commencer