2026年AI代理每月运行成本是多少?
2026年自托管AI代理的真实月度成本拆解:VPS、模型API、语音,以及不同使用量如何改变账单。
诚实的答案是每月 6 到 80 美元,绝大部分是模型花费
一个 24/7 运行在小型 VPS 上、使用 OpenRouter 或 Anthropic 密钥的个人 AI 代理,月成本通常在低配 6 美元到重度使用 80 美元之间。基础设施在这份账单里几乎可以忽略不计:每月 4 到 8 美元的小型 VPS 就够了,跟你和代理聊多少无关。这个基线之上的所有支出都属于模型花费,随代理为你读写的 token 数量增长。
如果你曾经试图从那些动辄给出 200 美元到 10000 美元月费的计算器里反推出这个数字,那些困惑是合理的。那些数字描述的是每月处理数万次对话的企业客服代理,而不是一个人在 Telegram 上使用的助手。本文拆解的是后一种情况:一位独立运营者、一个消息通道、诚实的算法。
为什么账单会分成两部分
一个 AI 代理的月度成本 = 两条相互独立的花费之和:
- 基础设施:一台保持在线、维护对话状态并运行消息网关的小型 Linux 服务器。固定成本。
- 模型花费:向模型提供商(OpenRouter、Anthropic、OpenAI)发起的按 token 计费的调用。可变成本,随使用量增长。
对个人代理来说,几乎没必要在自己的机器上跑模型。本地 LLM 推理需要 GPU 或 16-32 GB 内存,硬件账单会被推得比按 token 付费在真实个人使用量下还要高。本文其余部分都假设模型跑在提供商那边,你的 VPS 只是负责与它对话。
正是这种拆分让总成本可以被诚实地估算。基础设施的下限是可提前预知的;模型花费是消息数量和长度的函数。
第一条线:基础设施下限
一个基于 API 的代理,跑在 Telegram、Signal 或 Slack 上,对硬件的要求出奇地低。最低基线是 1-2 个 vCPU、1-2 GB 内存和 20-40 GB SSD。大部分 runtime,包括 Hermes Agent,都能在 2 GB 内存里舒服地运行。
2026 年这种配置的真实月费:
- Hetzner CX22(2 vCPU、4 GB 内存、40 GB NVMe):欧盟约每月 3.79 欧元,美国区约每月 4.59 到 4.99 美元。包含 20 TB 出站流量。自托管社区的默认推荐。
- DigitalOcean Basic Droplet(1 vCPU、1 GB 内存):每月 6 美元,2 GB 档约每月 12 美元。价格可预期、文档比 Hetzner 更清爽,代价是同规格价格贵 2-4 倍。
- Oracle Cloud Always Free ARM:如果你的账户能挺过回收策略,每月 0 美元。真正的免费额度,配上真正麻烦的账户审批。
- 家里的 Raspberry Pi 5:一次性 80 美元,24/7 运行大约每月 2-4 美元电费。长期更便宜,如果家宽不稳则可用性会打折。
第一次估算时,可以把 每月 6 美元 当作基础设施下限。从 Hetzner CX22 到小型 DigitalOcean droplet 都落在这条线上或以下。若想看清各项权衡,我们在 面向 AI 代理的便宜 VPS 里做过对比。
第二条线:模型花费
区间从这里开始张开。模型提供商按输入 token(模型读入的内容,包括不断增长的对话历史)和输出 token(模型写回的内容)分别按百万计费。1 token 大约相当于 4 个英文字符,约合 0.75 个英文单词。
2026 年中一个个人代理需要关心的价格:
- Claude Haiku 4.5:输入每百万 token 1.00 美元,输出每百万 token 5.00 美元。日常聊天里最划算的主力马。
- GPT-4o:OpenRouter 上输入约每百万 token 2.50 美元,输出每百万 token 10 美元。性能上大致与 Claude Sonnet 同档。
- Claude Sonnet 4.6:输入每百万 token 3.00 美元,输出每百万 token 15 美元。任务确实需要更强推理时再上。
- Gemini Flash:OpenRouter 上输入起价每百万 token 0.075 美元。主流选项里最便宜的一档,适合当作回退层。
有两件事会超出新手的预期:
- 每条消息都会把整段对话重放一次。 模型本身没有记忆。每条新消息处理时都相当于把之前所有轮次拼在输入前面,所以到第 10 轮时,同样内容的一次回复要按大约第 1 轮 7 倍的 token 计费。这就是为什么一个从不裁剪上下文的健谈代理,即便每条消息很短,看起来也可能很贵。
- 输出 token 比输入贵 4-5 倍。 一个爱啰嗦、给一句提问写一大段的模型,在相同回答质量下会比简洁模型多花五倍成本。
反映到真实的月度账单上
假设 1 token 约 4 字符,一次典型的短助手回复约 750 token,system prompt 大约几百 token 的额外开销。用 Claude Haiku 4.5 或类似输入价低于 1 美元的模型,三种使用画像的粗略、诚实数字大约是:
- 轻度使用(每天约 20 次对话,每次 6 轮):每月约 3-6 百万 token。每月 5-12 美元 模型花费。
- 中等使用(每天约 80 次对话,每次 8 轮):每月约 15-25 百万 token。每月 25-50 美元。
- 重度使用(每天约 200 次对话,每次 10 轮,加上语音转写和 TTS):每月约 40-80 百万 token 再加上音频。每月 60-150 美元。
全部改用 Claude Sonnet 4.6,这些数字大致翻三倍。全部改用 Gemini Flash,则大致减半。模型选择是所有变量里对总账单影响最大的一个。
可选项:语音
如果代理接收语音消息并用语音回复,账单还要多出两条可变支出:STT(语音转文本)把来音转录成文字,TTS(文本转语音)合成回复的语音。可以用来做预算的数字:
- OpenAI Whisper API:每分钟输入音频 0.006 美元。每天一分钟每月不到 0.20 美元;每天半小时约 5 美元。
- ElevenLabs:按用量计费,Starter 计划从每月 5 美元起,生产级实际使用视合成字符数量落在每月 22-99 美元之间。权衡细节见 Hermes Agent 的 ElevenLabs 语音设置。
- 自托管替代品:Whisper.cpp、faster-whisper、Piper、Edge TTS。软件层面免费,代价是你的 VPS 规格得多加几 GB 内存。
对大多数独立运营者而言,语音会在纯文本配置的基础上,按典型用量每月再增加 10-30 美元。
汇总:三种画像
把上面所有部分加起来,2026 年一个 24/7 运行的个人 AI 代理的诚实月度成本大概是这样:
- 轻度(纯文本、便宜模型、小型 VPS):每月 10-20 美元。基础设施 6,模型 5-12,语音 0。
- 中度(模型混用、偶尔语音、小型 VPS):每月 40-80 美元。基础设施 6,模型 25-50,语音 10-25。
- 重度(Sonnet 级模型、每天语音、内存有余量):每月 100-200 美元。基础设施 12,模型 60-150,语音 20-40。
主导账单的是模型选择,不是主机。一个用户如果从"什么都用 Sonnet"改成"聊天用 Haiku、难题才用 Sonnet",往往能把月度总账砍掉一半以上,同时并不会丢掉真正需要的推理能力。
隐藏的一条:你的时间
上面自托管数字都假设代理自己稳稳地跑着。实际情况是,第一个月通常要花一个晚上做初始配置,之后每次系统或 runtime 升级又要一个小时。速率限制、过期 API 密钥,或每晚静悄悄自动重启的 Docker 容器(在 Hermes Agent Docker 容器一直重启 里我们细讲过这个常见问题),每一次排查都要占用你自己的时间。
把这一项公允地记进账里的方法是按你自己的时薪算。如果照看一个自托管代理每月要花你两小时、你的时间值每小时 50 美元,那就相当于每月自己给自己付了 100 美元的实物工资。它很少出现在电子表格里,却是大多数独立运营者最终转向托管方案的真正原因。
托管方案
如果你更愿意不用管 VPS、不用管 OpenRouter 账户,也不想追踪这些细节:Hermify 在 Telegram 上运行托管的 Hermes Agent,持久记忆始终归你所有。入门档采用 BYOK(自带密钥)方式,因此模型花费仍然出现在你自己的账单上并由你掌控,只是基础设施那一行整个消失。如果你在做的是与品牌方案的对比研究,我们在 Hermes Agent 的价格是多少 里详细拆解了自家的各档方案。
这个取舍就是任何一篇月度成本文章诚实的收束:自托管代理的原始基础设施下限很便宜,模型花费两边都一样,隐藏的变量是这套配置会占掉你多少注意力。做决定之前,把这三条线都好好算一遍。