当 AI 学会自我进化,“缰绳”该怎么设计?
“用了 Hermes 三周后,有一天我发现它自己创建了一个新的 Skill——我从来没有要求过,它自己觉得’这个模式应该被记住’,就自动创建了。”
听起来很酷,但也让人不安:如果 AI 可以自主创建 Skill,那它会不会创建一些我不想要的 Skill?如果它学会了错误的模式,怎么纠正?
这就是自改进 Agent 的核心治理问题:当 AI 学会自我进化,你需要一套新的”缰绳”设计——不是限制它进化,而是确保它进化的方向是正确的。
Hermes 的治理体系建立在四层边界模型上:
边界层 控制范围 控制方式
─────────────────────────────────────────────────
核心策略层 模型选择、安全策略、数据主权 配置文件、环境变量
配置层 系统配置、工具权限、记忆策略 hermes config
Skill 层 工作方法、行为规则、自动化流程 SKILL.md 审核
输出层 每次对话的输出内容和行为 实时反馈、上下文约束
每一层都是对上一层的补充和细化,越往下越灵活,越往上越刚性。
控制范围:每次对话的输出内容和行为。
控制方式:实时反馈、上下文约束。
治理原则:最小干预——让 AI 有最大的自由度,只在必要时纠正。
# 实时纠正示例
# 用户:"这份报告太长了,我不需要测试细节,只需要安全问题和性能问题。"
# Hermes 会把这个偏好写入 Skill,下次自动调整
控制范围:工作方法、行为规则、自动化流程。
控制方式:SKILL.md 审核、版本回滚。
治理原则:事前审核 + 事后回滚——Skill 创建和修改需要用户确认,但可以随时回滚到之前的版本。
# 查看 Skill 变更记录
hermes skills history daily_code_review
# 回滚到上一个版本
hermes skills rollback daily_code_review
# 审核待确认的 Skill
hermes skills review-pending