Voltar ao Blog
HermesAI AgentsModels

Hermes 4 vs Hermes 3: o que mudou e qual escolher

Uma comparação concreta das famílias Hermes 4 e Hermes 3 da Nous Research, com um guia para escolher qual rodar no Hermes Agent BYOK.

Por Hermify Team||7 min de leitura
Comparação em tela dividida contrastando um wordmark de Hermes 3 com outro de Hermes 4 sobre fundo escuro, separados por uma linha verde fina

O que mudou entre Hermes 3 e Hermes 4

Hermes 3, lançado pela Nous Research em 2024, era uma família de fine-tunes completos do Llama 3.1 em 8B, 70B e 405B. O foco era alinhamento neutro e capacidade de direção: um assistente forte e sem censura que fazia o que você pedia sem acrescentar opiniões próprias. Não raciocinava passo a passo por padrão. Respondia.

Hermes 4, lançado em agosto de 2025, é outro bicho. Vem em três tamanhos (14B em cima do Qwen 3, 70B e 405B em cima do Llama 3.1) e adiciona um modo de raciocínio híbrido no qual o modelo escolhe se pensa em traços <think>...</think> antes de responder. O corpus de pós-treinamento cresceu cerca de cinquenta vezes: de mais ou menos 1M de amostras e 1,2B de tokens no Hermes 3 para cerca de 5M de amostras e 60B de tokens no Hermes 4, misturando dados de raciocínio e não-raciocínio. O treinamento rodou em 192 GPUs NVIDIA B200.

Depois, em dezembro de 2025, a Nous lançou o Hermes 4.3 36B. Ele é baseado na arquitetura Seed-OSS-36B da ByteDance, estende o contexto para 512K tokens e foi pós-treinado inteiramente na rede descentralizada Psyche da Nous. Quase iguala o Hermes 4 70B em avaliações com metade dos parâmetros.

Se você roda o Hermes Agent com sua própria chave do OpenRouter ou direta da Nous, a escolha de modelo virou algo genuinamente interessante. Aqui está o que muda e como escolher.

A família Hermes 4 em resumo

Modelo Base Modo raciocínio Melhor para
Hermes 4 14B Qwen 3 14B Sim Inferência local, dispositivos edge, rascunhos baratos
Hermes 4 70B Llama 3.1 70B Sim Cargas BYOK ajustadas em custo que precisam de qualidade real
Hermes 4 405B Llama 3.1 405B Sim Raciocínio de fronteira: matemática, código, STEM difícil
Hermes 4.3 36B Seed-OSS 36B Sim Trabalho com contexto de 512K, auto-hospedagem em uma GPU

Os quatro compartilham o mesmo truque de raciocínio híbrido: um único conjunto de pesos, um interruptor. Você não precisa manter um modelo de "raciocínio" separado de outro "instruct".

Raciocínio híbrido: o recurso que mais importa

No Hermes 3 você recebia uma resposta direta. Rápida, competente, resolvido.

No Hermes 4 você pode pedir qualquer um dos dois comportamentos no mesmo checkpoint. Com o modo raciocínio ativo, o modelo emite um bloco <think>...</think> com sua deliberação interna e depois a resposta final. Com o modo desligado, responde direto, como o Hermes 3 fazia.

Duas implicações para o uso dentro do Hermes Agent:

  • Você não precisa de dois slots de provedor. Aponte o BYOK para um único modelo Hermes 4 e alterne o modo por tarefa via system prompt ou convenção do wrapper. Mais barato e mais simples do que rotear entre modelos de raciocínio e não-raciocínio separados.
  • Você paga pelos tokens que o modelo gastou pensando. O modo raciocínio não é de graça. Um bloco <think> longo pode facilmente dobrar o custo de saída de uma pergunta difícil, então mantenha desligado para resumos rotineiros ou conversa casual.

Se quer entender melhor como um agente com raciocínio se comporta no dia a dia, nosso post sobre memória e skills do Hermes Agent mostra como os arquivos de memória mudam sobre o que o agente decide raciocinar.

Benchmarks: o que os números realmente dizem

No topo, o Hermes 4 405B em modo raciocínio reporta:

  • MATH-500: 96,3
  • AIME'24: 81,9
  • GPQA Diamond: 70,5
  • LiveCodeBench: 61,3

São números competitivos com o DeepSeek R1 671B e o Qwen 3 235B, em pesos abertos. A manchete do 96,3 no MATH-500 é real, mas trate como um teto para certo tipo de pergunta, não como promessa para qualquer prompt: em tarefas sem raciocínio o mesmo modelo se comporta mais como um Llama 3.1 405B bem ajustado do que como um raciocinador de fronteira.

O Hermes 4 70B perde alguns pontos nos benchmarks duros de raciocínio em troca de inferência cerca de seis vezes mais barata. O Hermes 4 14B é o modelo esquecido: é pequeno o bastante para rodar em uma única GPU de consumo e mantém o raciocínio híbrido, o que é raro nesse tamanho.

O Hermes 4.3 36B é o mais interessante de acompanhar. A Nous reporta que ele quase iguala o Hermes 4 70B com metade dos parâmetros, graças à base Seed-OSS maior e ao pós-treinamento distribuído sobre a Psyche. Também tem 512K de contexto, algo que o 70B não oferece.

Qual rodar no Hermes Agent

O Hermes Agent é agnóstico ao modelo. Você escolhe no config.yaml ou pela configuração do OpenRouter no Hermes Agent, e o arnês cuida do resto. Regra prática para usuários BYOK:

  • Resumo de contexto longo, memória de chat longa, revisão de código em arquivos grandes. Escolha o Hermes 4.3 36B. A janela de 512K é o fator decisivo. Nada mais na família compete aí.
  • Raciocínio duro: matemática, código novo, planejamento agêntico de muitos passos. Escolha o Hermes 4 405B em modo raciocínio. Desligue nos turnos rotineiros e ligue nos difíceis.
  • Modelo de uso diário ajustado em custo. Escolha o Hermes 4 70B. É o equilíbrio padrão. Boas respostas, preço razoável, e ainda entrega raciocínio híbrido se precisar.
  • Edge, local ou execuções offline. Escolha o Hermes 4 14B, ou o Hermes 4.3 36B se você tiver uma GPU mais parruda. Os GGUFs de 14B rodam confortavelmente em uma placa de gama média.
  • Você já tem um Hermes 3 funcionando e ele resolve seu trabalho. Não migre só por migrar. O Hermes 3 405B ainda é um assistente forte sem raciocínio. Mude só quando precisar de uma das quatro capacidades acima.

Para uma visão mais ampla sobre escolher a camada de provedor, veja nossa comparação de hosting vs auto-hospedagem do Hermes Agent. A escolha de modelo é em grande parte ortogonal a onde você roda o agente.

Como trocar de modelo no Hermes Agent

A troca é um ajuste de config, não um rebuild. No ~/.hermes/config.yaml:

model:
  provider: openrouter
  name: nousresearch/hermes-4-405b
  # Para acesso direto à Nous, use:
  # provider: nous
  # name: hermes-4-405b

Reinicie o gateway:

hermes gateway restart

Para o modo raciocínio, a maioria dos modelos Hermes 4 aceita uma flag reasoning: true ou enable_thinking: true do lado do provedor, ou você pode envolver seu prompt com uma diretiva <think> explícita no system prompt. Consulte a documentação do seu provedor antes de assumir o comportamento padrão.

Se você usa BYOK por um host gerenciado, a troca é ainda mais simples: mude a string do modelo no seu painel e envie uma nova mensagem. Sem reinício, sem rebuild de imagem.

Conclusão

De Hermes 3 para Hermes 4 há um salto maior do que o número de versão sugere. Você sai de um forte fine-tune do Llama 3.1 com capacidade de direção para uma família com raciocínio híbrido, benchmarks de fronteira competitivos, um pipeline de treinamento distribuído (4.3) e uma opção real de contexto longo. A migração é uma mudança de config se você já usa o Hermes Agent, e o ROI é maior em cargas com raciocínio real, contexto longo ou uma mistura dos dois.

Escolha o menor modelo da família que responda bem à sua pergunta mais difícil. Ligue o raciocínio só quando precisar. E fique de olho nos lançamentos da rede Psyche: o padrão do 4.3 (base menor, mais pós-treinamento, execução descentralizada) é quase certamente a forma dos próximos Hermes.

Comece com a Hermify se quiser que a troca de modelo seja um dropdown em vez de um arquivo de configuração, com um Hermes Agent rodando no Telegram enquanto você decide.

Fontes

Lance seu próprio agente Hermes

Traga sua chave de API, conecte o Telegram e tenha um agente de IA que evolui sozinho no ar em 60 segundos.

Começar agora