返回博客
HermesAI AgentsModels

Hermes 4 与 Hermes 3 对比:变化与选型指南

对 Nous Research 的 Hermes 4 与 Hermes 3 模型家族进行具体对比,附上在 Hermes Agent BYOK 中选型的实用指南。

作者:Hermify Team||阅读约 3 分钟
深色背景上分屏对比图,一侧为 Hermes 3 字标,另一侧为 Hermes 4 字标,中间由一条细绿色分隔线相隔

Hermes 3 到 Hermes 4 都变了什么

Hermes 3 由 Nous Research 于 2024 年发布,是 Llama 3.1 在 8B、70B 和 405B 三个规模上的完整微调家族。它的重心是中立的对齐与可控性:一位强大且无审查的助手,让它做什么就做什么,不会自作主张添加立场。默认情况下它并不逐步推理,而是直接作答。

Hermes 4 于 2025 年 8 月发布,是完全不同的物种。它推出三个规模(基于 Qwen 3 的 14B,基于 Llama 3.1 的 70B 与 405B),并新增了混合推理模式:模型可以自行选择是否在回答前用 <think>...</think> 轨迹进行推理。后训练语料规模大约扩大了五十倍:从 Hermes 3 的约 1M 样本、1.2B tokens,增长到 Hermes 4 的约 5M 样本、60B tokens,涵盖推理与非推理数据的混合。训练在 192 块 NVIDIA B200 GPU 上完成。

随后,Nous 在 2025 年 12 月发布了 Hermes 4.3 36B。它基于字节跳动的 Seed-OSS-36B 架构,将上下文扩展至 512K tokens,并完全在 Nous 自研的去中心化 Psyche 网络上完成后训练。以一半的参数量,它在评测中几乎追平了 Hermes 4 70B。

如果你在 Hermes Agent 中使用自己的 OpenRouter 或 Nous 直连密钥,模型选型现在变得真正有意思了。下面是关键差异与选择方法。

Hermes 4 家族一览

模型 基座 推理模式 最佳用途
Hermes 4 14B Qwen 3 14B 本地推理、边缘设备、低成本草稿
Hermes 4 70B Llama 3.1 70B 需要真实质量的成本敏感型 BYOK 工作负载
Hermes 4 405B Llama 3.1 405B 前沿推理:数学、代码、硬核 STEM 问题
Hermes 4.3 36B Seed-OSS 36B 512K 上下文任务,单 GPU 本地自托管

四款模型共享同一个混合推理机制:一份权重,一个开关。你无需分别维护「推理」模型与「指令」模型。

混合推理:最关键的一项能力

在 Hermes 3 上,你得到的是一次直接回复。快速、称职、结束。

在 Hermes 4 上,你可以在同一个 checkpoint 上按需要选择两种行为。开启推理模式时,模型会先输出一段 <think>...</think> 内部思考轨迹,然后给出最终回答;关闭后,它就像 Hermes 3 那样直接作答。

在 Hermes Agent 中使用它有两点实际影响:

  • 不需要两个服务商槽位。 让 BYOK 只指向一个 Hermes 4 模型,通过系统提示词或包装约定按任务切换模式,比在推理模型和非推理模型之间做路由更便宜、更简单。
  • 你要为模型「思考」的 tokens 付费。 推理模式并非免费。一段较长的 <think> 块很容易让一道难题的输出成本翻倍,所以在做常规摘要或闲聊时应保持关闭。

如果想更直观地了解带推理的智能体在日常中的表现,我们的Hermes Agent 记忆与技能一文展示了记忆文件如何影响智能体选择推理的对象。

基准测试:数字究竟说明什么

在最顶端,Hermes 4 405B 在推理模式下的得分为:

  • MATH-500:96.3
  • AIME'24:81.9
  • GPQA Diamond:70.5
  • LiveCodeBench:61.3

在开放权重的范围内,这与 DeepSeek R1 671B 和 Qwen 3 235B 具有竞争力。MATH-500 的 96.3 是真实数字,但更该看作某类问题的上限,而非对任何 prompt 都成立的承诺:在非推理任务上,同一个模型的表现更像一个调优良好的 Llama 3.1 405B,而不是前沿推理器。

Hermes 4 70B 在最难的推理基准上损失几分,换来大约六分之一的推理成本。Hermes 4 14B 是被低估的黑马:小到能在一张消费级 GPU 上跑,同时保留混合推理能力,这在这一规模并不常见。

Hermes 4.3 36B 是最值得追踪的一款。Nous 报告称,它以一半参数量几乎追平了 Hermes 4 70B,得益于更大的 Seed-OSS 基座与基于 Psyche 的分布式后训练。它还提供 70B 不具备的 512K 上下文窗口。

在 Hermes Agent 中该选哪一款

Hermes Agent 与模型无关。你在 config.yaml 里或通过Hermes Agent 的 OpenRouter 配置选择模型,其余交给框架处理。BYOK 用户的经验法则:

  • 长上下文摘要、超长聊天记忆、对大文件的代码审查。 选 Hermes 4.3 36B。512K 上下文窗口是决定性因素,家族中没有其他模型能与之匹敌。
  • 硬核推理:数学、原创代码、多步的智能体规划。 选 Hermes 4 405B 并开启推理模式。常规轮次可以关掉推理,硬活时再打开。
  • 成本可控的日常主力。 选 Hermes 4 70B。它是平衡的默认选择,回答质量好、价格合理,需要时依然带来混合推理。
  • 边缘、本地或离线运行。 选 Hermes 4 14B;若显卡更强,可选 Hermes 4.3 36B。14B 的 GGUF 在一张中端显卡上就能舒服地跑起来。
  • 你已经跑着 Hermes 3,业务运转良好。 不要为了迁移而迁移。Hermes 3 405B 仍是一个强大的非推理助手,只有在你确实需要上述四种能力之一时才切换。

要更全面地看待服务商层的选择,可参考我们对比Hermes Agent 托管服务与自托管的文章。模型选择与你在何处运行智能体在很大程度上是彼此独立的两件事。

在 Hermes Agent 中如何切换模型

切换是配置修改,不是重新构建。在 ~/.hermes/config.yaml 中:

model:
  provider: openrouter
  name: nousresearch/hermes-4-405b
  # 若要直接接入 Nous,请使用:
  # provider: nous
  # name: hermes-4-405b

重启网关:

hermes gateway restart

对于推理模式,多数 Hermes 4 模型在服务商侧接受 reasoning: trueenable_thinking: true 之类的开关,你也可以在系统提示词层显式加入 <think> 指令。在假设默认行为之前,请先查阅所用服务商的文档。

如果你通过托管服务使用 BYOK,切换更简单:在控制台里改一下模型名,然后发一条新消息即可。无需重启,也无需重新构建镜像。

小结

从 Hermes 3 到 Hermes 4 的跨度,比版本号所暗示的要大得多。你从一款可控性强的 Llama 3.1 微调,走向了一个具备混合推理、竞争力堪比前沿开源模型、拥有分布式训练流水线(4.3)以及真正长上下文选项的模型家族。若你已经在跑 Hermes Agent,迁移只是一次配置更新;ROI 最高的场景,是那些真正涉及推理、长上下文,或两者兼有的工作负载。

选择家族中能把你最难那道题答好的最小模型。仅在需要时才打开推理。同时留意 Psyche 网络上的后续发布:4.3 的模式(更小的基座、更大的后训练、去中心化训练)几乎可以肯定就是下一批 Hermes 的形态。

开始使用 Hermify:如果你希望模型切换变成一个下拉菜单,而不是一个配置文件,同时在你还在做选择时,Telegram 上就有一个 Hermes Agent 在跑。

参考资料

运行你自己的 Hermes Agent

自带 API 密钥,连接 Telegram,60 秒内即可上线一个自我改进的 AI 智能体。

立即开始