2026 年 Hermes Agent 最便宜的 OpenRouter 模型
2026 年 OpenRouter 上每百万 token 低于 1 美元的模型短名单,按 Hermes Agent 真实工具调用负载与月度总成本排序。
真正的问题是什么
如果你已经选定了 OpenRouter 作为服务商,接下来你想知道的不是"哪个模型最好",而是"在能撑住 Hermes Agent 工作负载的前提下,哪个模型最便宜"。这是一个更聚焦的问题,2026 年比一年前有了清晰得多的答案。
Hermes Agent 是一个高度依赖工具调用的运行时。每一轮它都会把系统提示、长长的工具定义列表、最近的对话历史,以及打开过的文件一并交给模型。而输出通常很短:一段简短回复外加一两次工具调用。这种"入多出少"的结构,正是带缓存折扣的模型格外划算的原因。所以这里所说的"最便宜",指的是"考虑到 Hermes 与模型的对话方式后最便宜的选择",而不是营销页面上标价最低的那个。
每百万 Token 低于 1 美元的模型短名单
以下是 2026 年 7 月 OpenRouter 上输入与输出均低于每百万 token 1 美元的模型。价格是 OpenRouter 从上游服务商透传过来的。有些模型技术上更便宜,但对工具 schema 的遵循并不好,或者在压力下会丢函数调用,就没有出现在这份名单里。因为在 Hermes Agent 里,一次错误的工具调用意味着整轮 token 白费,还必须重试。
| 模型 | 输入 $/M | 输出 $/M | 缓存折扣 | 备注 |
|---|---|---|---|---|
| DeepSeek V4-Pro | 0.435 | 0.87 | 最高约 99%(缓存命中 $0.003625/M) | 工具调用稳定,1M 上下文,开放权重 |
| DeepSeek V4-Flash | 0.14 | 0.28 | 缓存命中 $0.0028/M 输入 | DeepSeek 中最快的一档,适合辅助任务 |
| GPT-4.1 Nano | 0.10 | 0.40 | 上游 OpenAI 提供 prompt caching | 本组中工具遵循能力最弱 |
| Gemini 2.5 Flash Lite | 0.10 | 0.40 | 无明确缓存折扣 | 速度快,工具调用可接受 |
| Llama 4 Scout(Groq / DeepInfra) | 0.08 - 0.11 | 0.30 - 0.34 | 无缓存折扣 | 实测延迟最低,测试免费额度慷慨 |
真正跑 Hermes Agent 时,有两件事比标价更关键。
第一,Hermes 几乎每一轮都会重复发送相同的工具定义。这正是 KV 缓存被设计出来要处理的模式。在 DeepSeek V4-Pro 上,一次缓存命中的成本是每百万输入 token $0.003625,约为未命中价格的 1/120。经过真实一周的使用后,命中缓存的 token 会占大头,实际每轮成本远低于账面数字。
第二,如果模型在压力下返回格式错误的工具调用,Hermes 会重试。每次重试都是一整个新的输入轮。一个便宜 20% 但会漏掉 10% 工具调用的模型,实际花费会高于一次就能答对的"更贵"模型。这也是为什么即便有些模型标价更低,DeepSeek V4-Pro 仍居这份名单之首。
大多数人真正想要的配方
在 OpenRouter 社区里,最常见的 Hermes 低成本部署方式是双模型分工:让 Hermes 使用一个更强的模型跑主推理循环,把辅助任务(上下文压缩、聊天标题、图像转文本、会话总结)路由到更便宜的模型上。
在你的 ~/.hermes/config.yaml 里,大致是这样:
provider: openrouter
model: deepseek/deepseek-v4-pro
openrouter_api_key: sk-or-your-key-here
auxiliary_model:
compression: openai/gpt-4.1-nano
title_generation: openai/gpt-4.1-nano
vision: google/gemini-2.5-flash-lite
web_summary: openai/gpt-4.1-nano
主模型负责硬核推理和工具调用,辅助模型处理 Hermes 在后台默默完成的事情,它们对模型能力更宽容。这样一套组合能以接近最便宜的档位覆盖约 95% 的交互。
如果你想先从头看一遍 OpenRouter 完整配置,可以读 如何为 Hermes Agent 配置 OpenRouter。本文假设你已经有 OpenRouter 密钥,正在挑选模型。
便宜模型的短板
在这个价格档位诚实的取舍是:低于 1 美元的模型擅长由技能驱动的重复性任务,在全新、困难的推理上更弱。Hermes Agent 的日常工作 - cron 定时摘要、RSS 汇总、写入记忆、"明天提醒我"、Telegram 消息分流 - 恰恰是便宜模型能够胜任的工作类型。
便宜模型撑不住的场景:
- 长链路多步调试,模型必须持有大量状态并不断修正计划
- 法律或医疗类文书起草,任何微小事实错误都会带来严重后果
- 对非平凡 diff 的代码审查,语义细节至关重要
- 任何"90% 正确比 100% 正确差得多"的任务
面对这些情况,答案不是"买一个更大的便宜模型",而是"按任务分流"。把 DeepSeek V4-Pro(或同档次的其他低于 1 美元模型)留作默认,为需要更高质量的具体技能配置一个到 Claude Sonnet 或 GPT-4o 的兜底路径。这样你只在少数真正需要顶级质量的轮次里花顶级价格,其余 95% 依然享受便宜价格。
Hermes Agent 的最佳模型服务商 那篇文章从服务商层面深入讨论这种取舍。本文更聚焦一级:既然你已经选择了 OpenRouter,那么应该路由到哪一个具体模型。
这对你的月度账单意味着什么
如果你自托管 Hermes 并直接在 OpenRouter 上为模型付费,低于 1 美元的这一档就是让月度账单真正变小的关键。一个每天使用 Hermes 的用户,配几条 cron、每天几十次对话,选用 DeepSeek V4-Pro 且缓存命中正常,通常每月只花几美元的低位区间。大量使用语音模式或网页抓取会推高数字,但不会翻一个数量级。
如果你在 Hermify 的 Starter 档,模型的支出是 BYOK(自带密钥)走 OpenRouter,所以上面的选择直接决定你的月度账单。绝大多数 Starter 用户在体验一两周后,最终会集中到"主模型 DeepSeek V4-Pro + 辅助任务用 nano"这一组合。
如果你不想再费心算模型账,或者更希望有一条稳定的成本项而不是浮动的 API 账单,那么带打包密钥的托管档位就是合适的方案。完整拆解见 运行 Hermes Agent 究竟要花多少钱。
接下来怎么做
如果你想要最短路径:
- 注册 OpenRouter,充少量额度。
- 在
~/.hermes/config.yaml中设置model: deepseek/deepseek-v4-pro。 - 添加 auxiliary_model 块,把压缩和标题任务指向
openai/gpt-4.1-nano。 - 让 Hermes 跑一周,同时观察 OpenRouter 控制台,你会看到主模型的缓存命中占比迅速上升。
如果你干脆想跳过配置文件本身,开始使用 Hermify。我们在 Telegram 上运行托管的 Hermes Agent,你连接自己的 OpenRouter 密钥,默认就是"DeepSeek + 辅助模型"的同款方案。你可以专注于代理能替你做什么,而不是维护让它运转起来的配置。
参考资料
- Lowest-Cost LLM Inference: The Complete OpenRouter Guide
- Hermes Agent + OpenRouter: Setup, Model Choice & Routing Config
- DeepSeek API Pricing 2026: V4-Flash & V4-Pro Per-Token Costs
- DeepSeek V4: 1.6T MoE, 1M Context, $0.87/M Output
- Configuring Models - Hermes Agent, Nous Research
- AI Model Pricing Comparison 2026