返回博客
AI AgentsSelf-hostingHardware

在树莓派上运行 AI Agent(2026):一份诚实指南

树莓派真的能承担 24/7 的 AI agent 吗?RAM 上限、ARM64 镜像、SD 卡损耗,以及为什么 5 欧元的 VPS 常常更划算。

作者:Hermify Team||阅读约 3 分钟
一台桌面上的 Raspberry Pi 5,深色场景,上有文字 'AI Agent on Raspberry Pi'

问题不在能不能跑起来,而在能不能一直跑

如果你打开了这篇文章,多半你的架子上就摆着一块树莓派,并且打算把它接到一个个人 AI agent 上。好消息是:Pi 5 只要有 4 GB 或更多内存,就能顺利跑起 Hermes Agent、OpenClaw 或者一小段 Ollama 循环这类基于 API 的 runtime。坏消息是:大多数跑在树莓派上的 agent,最后并不是被 CPU 打垮的,而是死于其他东西:凌晨三点的 SD 卡损坏、语音转写中途因内存压力被 OOM 杀掉,或者根本从没构建过 ARM64 版本的 Docker 镜像。

本文集中讲三件真正决定 24/7 树莓派 agent 成败的事:选哪块板、多少内存合适;如何让存储活得久一点;以及模型推理该怎么处理。它也把树莓派配件卖家不会告诉你的那句大实话说出来:对不少读者来说,一个 5 欧元/月 的 VPS,反而比你手头这块树莓派更便宜也更省心。

Pi 4 与 Pi 5:CPU 提升是实打实的,但决定权在 RAM

Pi 5 把 Pi 4 上的 Cortex-A72 升级成了 Cortex-A76,主频从 1.5 GHz 提到 2.4 GHz,缓存更大,指令并行度明显更高。对于一个大部分时间都在等待远端模型网络 I/O 的 agent 来说,CPU 的差异集中体现在一件事上:突发活跃过后,消息网关、工具循环和本地音频处理反应有多快。Pi 5 上运行 Docker 或 Node 相关的东西,冷启动明显比 Pi 4 利索。

真正逼你做出购买决定的是 RAM,而不是主频。2026 年跑一个和托管 LLM 对话的 agent 栈,合理档位大致是:

  • Pi 4,2 GB:太紧。Runtime、消息网关,再加一次 Chromium 工具调用,就会在内存压力下崩掉。
  • Pi 4,4 GB:能跑一个和远端模型对话的单 agent,不能带本地 Whisper,也别开浏览器工具。要有心理准备关掉 swap,并小心并发进程。
  • Pi 5,4 GB:合理的下限。带 1 到 2 个消息渠道和持久化记忆的 Hermes Agent 类 runtime 用起来还算从容。用 faster-whisper 做本地 STT 也能做,但很痛苦。
  • Pi 5,8 GB:对于希望有余量、偶尔跑无头浏览器工具,或者跑一个小型本地模型的人来说,这是实用中的甜点。社区在本地推理上的基准也印证这一点:Pi 5 8 GB 在纯 CPU 下能让 TinyLlama 1.1B 跑到约 18 token/s,Llama 3.2 3B 到约 9 token/s。
  • Pi 5,16 GB:只在你打算跑 7 B 级本地模型时才有必要。一个 Q4_K_M 量化的 7 B 大约占用 5 GB 内存,所以要留出余量。

无论选哪一档,Pi 5 都别省掉主动散热。持续的热降频,几分钟真实负载下就能把一颗灵活的 2.4 GHz A76 变成比 Pi 4 还慢的东西。

ARM64 镜像可用性:动手前先确认

到 2026 年,绝大多数正经的 agent runtime 都会发布 ARM64 镜像,但坑仍然存在。真正下决心之前,先针对你打算使用的 runtime 检查三件事:

  • 容器镜像的 manifest 里包含 linux/arm64/v8。运行 docker manifest inspect <image>,看看有没有 ARM 条目,或者直接用多架构 pull。
  • 镜像确实是最近构建的。有些项目发过一次 ARM tag 就再也不管,然后在几个月里悄悄地和 AMD64 版本拉开差距。
  • 你依赖的可选依赖(ffmpeg、sox、Chromium、Playwright)在 ARM 上能用。Playwright 内置浏览器的下载在 ARM Linux 上尤其经常出问题,最后往往还是要用 apt 装 Chromium。

如果你打算用 Hermes Agent,官方 Docker 镜像是多架构的,能在 ARM 上跑。想完整了解 Docker 路径下 ARM64 版本的部署,我们的 Docker 部署指南 讲了镜像布局;在做第一个 24 小时通电测试之前,还建议先看一眼 容器反复重启的故障排查,因为大多数树莓派上的失败最终都落在同样的 OOM kill 和卷权限两大类里。

SD 卡才是杀掉你可用性的那个部件

树莓派跑着一个把一切都写进日志的操作系统,而 AI agent 又额外增加了一个不停写入的记忆目录:会话状态、按用户的记忆文件、转写、计划任务历史。这种连续的小块写入模式,正是消耗消费级 microSD 的方式。在 24/7 运行下,问题不是 SD 卡会不会坏,而是什么时候坏。

三条缓解措施,按效果由大到小:

  1. 从 NVMe 或 USB SSD 启动,别从 SD 启动。 Pi 5 通过 HAT 支持 NVMe,Pi 4 在近期固件下也能开箱从 USB SSD 启动。随机写入性能高出一个数量级,寿命特性也友好得多。这是你能做的最大的单项可靠性升级。
  2. 如果一定要用 SD,选高耐用等级卡。 SanDisk MAX Endurance、Samsung PRO Endurance、Transcend High Endurance 都是专为连续写入设计的。写入很重的场景下,一张普通消费级卡可能只撑几个月就衰退。
  3. 把记忆目录和任何 SQLite 数据库从启动介质上挪走。 挂一块小容量外置 USB SSD,挂载到 runtime 的数据路径上。启用 Log2Ram,让 systemd 的 journal 存在内存里,只按周期落盘。把 /tmp/var/tmp 配成 tmpfs。

不管最后用哪种存储,都请给记忆目录设一个脚本化的、写到 Pi 外部的备份。抽屉里的一张死 SD 是一回事;抽屉里的一张死 SD、上面存着你 agent 六个月的上下文,是完全另一回事。

本地模型还是远端模型:买硬件前先决定

最大的一次分岔,是模型跑在树莓派上,还是跑在别处。

远端模型(多数个人场景推荐): 树莓派负责跑 runtime、消息网关、记忆文件和工具循环。模型调用通过 HTTPS 走到 OpenAI、Anthropic 或 OpenRouter。整体 RAM 占用可以稳稳保持在 1 GB 以内。而这也正是 5 欧元/月 的 VPS 能做的事,所以走这条路时,树莓派相对 VPS 的唯一优势就是"它就在你家里"。

本地模型跑在树莓派上: 全程离线。你被限制在小型模型上(在 Pi 5 8 GB 上大致是 1 B 到 3 B 参数、对话速度可接受),质量与现代托管模型之间有相当明显的差距。Pi 5 16 GB 配 NVMe 启动可以让一个量化的 7 B 上线,但每一秒延迟你都能感觉到。对于爱好者或追求隐私、期待值合理的场景,够用。对于真正想省时间的工作助手,通常不够。

语音上是同样的分岔:Deepgram、Whisper API 之类的云 STT 延迟,在每一轮对话上都能比树莓派上本地跑的 faster-whisper 快好几秒。如果低延迟语音很重要,那不管内存多少,树莓派都是错的硬件形态。

一份诚实的成本对比

如果你已经有了这块树莓派,Pi 5 24/7 长期通电的电费大约相当于 3 W 空载,按 0.30 欧元/kWh 算,一年在 7 到 8 欧元左右。很便宜。但托管一个 agent 的总成本公式,是 Pi + 高耐用 SD(或 NVMe HAT + NVMe SSD)+ 电源 + 外壳 + 主动散热,一切加起来,往往和一年入门 VPS 的费用只差几欧元。

具体来说:

路径 前期一次性 每月
Pi 5 8 GB + NVMe HAT + 256 GB NVMe + 散热 + 电源 + 外壳 约 180 欧元 约 0.60 欧元 电费
Netcup VPS 500(2 vCore ARM,4 GB RAM,128 GB NVMe) 0 欧元 约 5.00 欧元
Hetzner CX22(2 vCPU x86,4 GB RAM,40 GB NVMe) 0 欧元 约 3.79 欧元

树莓派相对 5 欧元/月 的 VPS,大约要到第三年才回本,而且前提是树莓派上什么都不出问题。一次 SD 卡更换或者一次电源更换,都会把这个计时重置。这些 5 欧元/月 选项的具体规格,廉价 VPS 对比 讲得更细;模型账单的位置,Hermes 费用拆解 会帮你放到全局里看。

树莓派在三个 VPS 无法比拟的维度上确实赢:它就在你家,几乎不耗电,并且在"没有云厂商拿着这块盘"这个意义上是真正私密的。这些都是实打实的理由。"更便宜"通常不是。

什么时候树莓派是对的选择

  • 你已经有了,它本来也是闲置。
  • 你想让 agent 物理上处在你的家庭网络里,接一些只在局域网工作的工具(Home Assistant、本地文件访问、Zigbee 协调器)。
  • 你把隐私放在性能之上,并接受本地模型的质量差距。
  • 你把折腾这套硬件当成一个项目本身来享受。这是完全合理的理由,本指南不打算劝你放弃。

什么时候干脆跳过树莓派

  • 你还没这台机器,是从零开始预算。
  • 你想要低延迟语音。
  • 你想以真实速度运行一个正经的托管质量模型(任何 7 B 及以上)。
  • 你根本不想操心 SD 卡损耗、热降频或 ARM 镜像可用性。

对最后一种情况,托管服务的存在正是因为并不是每个人都觉得周日下午拿来"选型、加固、盯着看"是件有趣的事。从 Hermify 开始,直接跳过整段硬件决策。它在 Telegram 上运行一个托管的 Hermes Agent,持久化记忆始终归你所有,既不用给电路板散热,也不用换 SD 卡。

建议

如果你已经有一台 4 GB 及以上的 Pi 5 加 NVMe HAT,就在上面跑一个基于 API 的 agent,享受微不足道的电费。如果是从零起步,那就直接买一台 5 欧元/月 的 ARM VPS。如果你希望这个 agent 直接工作、完全不用聊硬件的话题,就用托管服务。

树莓派是一台可爱的计算机。对大多数人来说,它并不是让 AI agent 一直在线的最便宜、也不是最省心的方式。

Sources

运行你自己的 Hermes Agent

自带 API 密钥,连接 Telegram,60 秒内即可上线一个自我改进的 AI 智能体。

立即开始