一晚六轮实测 Hermes Agent,会记笔记的 Agent 离上岗还差几步
29 块钱一个月的模型套餐,一台吃灰的 4 核 5GB 服务器,这是我这次测 Hermes Agent 的全部投入。服务器之前堆着一堆过期服务,内存常年挂在 60%,清理完掉到 8%。从部署到六轮实战跑完,一个晚上。
Hermes Agent 是 Nous Research 今年 2 月开源的项目,MIT 协议随便用,GitHub 4.2 万 star。开发者社区有条评价传得很广,说它开箱即用的体验,像是你花了一周以上调教过的 OpenClaw。
老雷这两年帮企业搭 Agent 体系,OpenClaw 的配置写了几千行,坑踩了个遍。听到这句话的第一反应是不服,第二反应是去验证。这篇就是验证结果,六轮实测加源码分析,给正在选型的工程师一份能对照的报告。
先给社区评价过一遍筛子
动手之前,我的习惯是先看真实用户的反馈,把水军和营销号滤掉再下判断。
正面的声音集中在两点。一位区块链领域的开发者测了几周,结论是 Nous Research 团队展现了扎实的工程能力,Hermes 很稳,这条讨论有 3035 次浏览。一位 OpenClaw 老用户用了一周后的态度是,如果你喜欢 OpenClaw,这个项目你也会感兴趣。技术社区最高赞的对比贴,就是前面那句开箱体验像调教一周以上的 OC。
负面和中肯的评价更值得看。一位写过 Hermes 部署教程的技术博主踩到一个严重 bug,压缩功能失败,对话记录无限膨胀,Agent 卡死 10 分钟以上,这条讨论 7272 次浏览,是社区里最热的一条。压缩死循环在后续版本修掉了,但能说明 Hermes 还处在打补丁的阶段。一位中文用户吐槽得更直接,用了几天就碰上更新迭代的代码里出现根本不存在的 API 接口。一位安全研究者做了 24 小时攻击测试,结论是他们修了一部分漏洞,但仍然能通过恶意链接接管运行 Hermes 的机器。还有一句大实话流传很广,目前这些 Agent 都是玩具,不愿意自己改代码的话,等 2027 年稳定了再说。
筛完的判断是,好评集中在开箱体验和 Skill 闭环,差评集中在稳定性和安全性,而后两样恰恰是生产环境最要命的。带着这个预设往下测。
六轮测试,第三轮才见真章
第一轮验记忆。我提前在 MEMORY.md 和 USER.md 两个文件里写好基本信息,重启后开全新会话直接问它知道我是谁吗。19 秒后回复,身份、业务方向、做事偏好全部准确,没有编造。但这一轮只能证明记忆文件会被自动加载,因为内容是我提前写的,算不上它自己学的。
第二轮验工具调用。让它搜索最近一周 AI Agent 领域最火的三个开源项目,分析特点并给推荐排名。它没有拿模型自带的旧知识硬答,而是启动内置的无头浏览器打开 GitHub Trending,滚动、截图、逐个点进项目详情页,总共调了 15 次工具,拿到 hermes-agent 单日涨 5794 star、andrej-karpathy-skills 涨 1371、DeepTutor 涨 1306 的实时数据。数据是真抓的,不过这个能力 OpenClaw 也有,不算独特优势。
第三轮开始,差距出来了。我给了一个多步骤任务,做完整的 GitHub 趋势分析,搜热门榜、筛 AI 项目、写摘要、写朋友圈文案,然后特意补了一句这是我每周都要做的事。它自动跑完 7 个步骤,全程没问一个中间问题。稀奇的是结尾,它主动问要不要把这个流程存成 Skill,下次说一声「做 GitHub 趋势分析」就能自动完成。7 个步骤的复杂度加上每周重复的信号,它自己判断出这活儿值得沉淀。OpenClaw 做完就结束了,想复用得自己手写 Skill 文件,门槛差别就在这里。
第四轮看存下来的东西。打开它写的 SKILL.md,有触发条件,有 6 个步骤,每步带具体网址、筛选规则和输出格式要求,不是糊弄人的笼统文档,是拿着就能照着执行的作业指导书。当然质量跟底层模型强相关,换个弱模型未必有这个成色。
第五轮最关键,也是整个测试里我印象最深的一步。我给了三条修改意见,视野放宽到全类别再筛选,文案改成口语化,加一步分析业务参考价值。它直接改写了 Skill 文件,不是只在对话里说知道了。筛选步骤改了,新增的业务分析步骤加了,文案风格从正式公告改成了「GitHub trending 看了看,说几个有意思的」这种口气。三条反馈全部落进文件,永久生效,下次调用自动就是修正后的版本。
第六轮收口。新开会话,只说五个字,做 GitHub 趋势分析。它加载的是修正后的版本,输出开头就是口语化风格,还多出一段第一轮根本没有的业务价值分析,三个项目逐个给了判断。三次执行,三次不同,第一次原始版,第二次纠正写回,第三次自动复用纠正后的成果。闭环是真的跑通了。

拆开源码,自学习就是记笔记
体验归体验,老雷建议所有准备引入的团队把源码翻一遍再下决策,里面有五件官方没说透的事。
第一,Skill 创建没有高级机制。源码里没有独立的技能创建工具,所谓 Skill 的创建和修改就是调用文件读写工具,让模型把流程写成一个 Markdown 文件。不是神经网络权重更新,不是强化学习,就是 AI 写了篇笔记存在硬盘上,下次自己再读。
第二,记忆系统有硬上限。源码写死了 MEMORY.md 最多 2200 字符,大约 800 个词,USER.md 最多 1375 字符,大约 500 个词。装满就得手动清理或让 Agent 压缩。对企业场景来说这点容量偏紧,光一堆业务规则就可能塞满。
第三,自动学习其实是半自动。社区不止一个用户吐槽,跑了几天记忆文件一个字没写进去,还得手动提示它去记。我这次能触发 Skill 创建,前提是我明说了「每周都要做」,不给这个暗示它未必主动。
第四,小模型基本废掉。有用户拿参数量 100 亿以下的本地模型跑,工具调用频繁出错,选错工具、传错参数、直接卡死。Hermes 对模型能力有一条隐性下限,选型时预算得往中档以上配。
第五,并行任务直接崩。有人让它同时抓取多个网站,原话是它直接拉了。单 Agent 架构天生不擅长并行,OpenClaw 的多 Agent 编排在这方面明显更强。
别被 self-improving 这个词忽悠,它没有在进化,它在记笔记。不过从完全没有到半自动记笔记,对重复性工作已经是实质性改善。

跟 OpenClaw 比个账
两个框架的对比社区讨论很多,我按六个维度逐一过。
开箱体验,Hermes 赢,装上就能用,OpenClaw 要写大量配置。多 Agent 协作,OpenClaw 赢,10 个以上 Agent 能并行跑业务,Hermes 是单 Agent,并行直接崩。Skill 自学习,Hermes 赢,做完任务主动提议沉淀,OpenClaw 目前没有这个机制。稳定性打平,一个成熟但配置复杂,一个新但问题多。社区规模 OpenClaw 赢,34.6 万 star 配 4.4 万多个现成 Skill,Hermes 4.2 万 star 还在发展期。成本 Hermes 赢,模型费用 29 块一个月起步,OpenClaw 订阅制一个月一千多。
还有一个体验层面的细节值得单拎出来。Hermes 跑长命令时没有进度反馈,你分不清它是在干活还是已经挂了,只能盯着屏幕干等。跑短任务无所谓,跑长流程的时候这种不确定感很磨人,也容易让人中途误判去乱动会话。
一位 OC 老用户的总结我很认同,说 Hermes 更稳定还为时过早,更准确的描述是不同的取舍,不是证明了谁更优。已经投入大量精力搭好体系的话,换不换都一样。

什么人该上,什么人别动
测完六轮加上源码分析,我的结论按场景拆。
Hermes 适合还没搭自己 Agent 体系的团队和个人。Skill 闭环让重复性工作做着做着就积累下来了,不需要提前规划,成本门槛也低,几十块的模型费加几十块的服务器就能跑。已经有一套顺手体系的,不管是 OpenClaw 还是 Claude Code,别因为新东西出来就急着换,迁移成本和重新踩坑的时间远大于收益。
给准备上 Hermes 的工程师一份上线前检查单。模型选中档以上,接入前先拿真实任务实测工具调用的成功率。记忆文件的上限提前规划清理策略,别等装满了才发现关键信息被压缩掉。关键流程存成 Skill 后,必须开一个全新会话用一句话验证能否复现,验证过的 Skill 才算数。部署不要暴露公网,恶意链接接管机器的攻击路径社区已经实测过,内网使用加最小权限是底线。生产环境等稳定版再上,探索和学习场景现在就能玩。
工具服务人,不是人追工具。重复的事情不再需要从零开始,才是衡量一套 Agent 体系值不值的标准。
老雷的判断就一句,Hermes 是条更快的路,但还不是更稳的路。快速验证业务想法可以用它,长期生产交付再观望两个版本。