自改进引擎:学习循环的五步飞轮

为什么 Hermes 能”越用越好用”?秘密就在这个闭环里

引子:一个真实的故事

2026年3月,一位开发者分享了他的使用体验:

“第一周,Hermes帮我做代码巡检,每次都要我手动指出哪些问题该关注、哪些该忽略。第二周,它开始自动过滤掉我之前标记为’不重要’的警告。第三周,它甚至主动建议了一个我之前没想到的检查维度。到了第四周,我几乎不需要再纠正它了——它已经’学会’了我的巡检偏好。”

这不是魔法,而是 Hermes 学习循环(Learning Loop) 的实际运作效果。

传统 AI Agent 做完任务就结束了——你纠正了它的错误,下次新对话它可能犯同样的错。Hermes 做完任务后,会自动复盘、自动沉淀经验、自动改进后续行为——你纠正一次,它永远记住。

学习循环的核心逻辑

学习循环可以概括为五个环节,形成一条连续链路:

记忆策划 → Skill创建 → Skill改进 → 检索召回 → 用户建模
    ↑                                              │
    └──────────────────────────────────────────────┘
                    (闭环)

这五步不是并列功能,而是前后依赖的闭环。每一步的输出是下一步的输入,最后一步的输出又回到第一步——形成持续运转的飞轮。

用一个真实场景理解五步闭环

假设你让 Hermes 帮你做”每日代码巡检”。

第一轮:冷启动

步骤1:记忆策划 Hermes 没有相关记忆,从零开始执行巡检任务。它检查了所有代码变更,生成了一个包含50个问题的报告。

步骤2:Skill 创建 你指出”其中30个问题是lint警告,我不关心lint”。Hermes 识别到这个反馈有复用价值,自动创建了一个 Skill 草稿:daily_code_review,其中包含规则”过滤lint警告”。

步骤3:Skill 改进 你进一步指出”还有5个问题是测试覆盖率下降,这个我关心”。Hermes 把这个偏好写入 Skill,更新规则为”过滤lint警告,但关注测试覆盖率变化”。

步骤4:检索召回 下次巡检时,Hermes 自动检索到 daily_code_review Skill,按规则过滤和排序问题。

步骤5:用户建模 Hermes 从多轮交互中提炼出你的偏好模型:“这个用户重视测试质量和安全性,不关心代码风格细节。”

第二轮:飞轮开始转动