治理边界:自改进 Agent 如何既自主又可控

当 AI 学会自我进化,“缰绳”该怎么设计?

引子:当 AI 开始”自作主张”

“用了 Hermes 三周后,有一天我发现它自己创建了一个新的 Skill——我从来没有要求过,它自己觉得’这个模式应该被记住’,就自动创建了。”

听起来很酷,但也让人不安:如果 AI 可以自主创建 Skill,那它会不会创建一些我不想要的 Skill?如果它学会了错误的模式,怎么纠正?

这就是自改进 Agent 的核心治理问题:当 AI 学会自我进化,你需要一套新的”缰绳”设计——不是限制它进化,而是确保它进化的方向是正确的。

四层边界模型

Hermes 的治理体系建立在四层边界模型上:

边界层      控制范围              控制方式
─────────────────────────────────────────────────
核心策略层   模型选择、安全策略、数据主权    配置文件、环境变量
配置层      系统配置、工具权限、记忆策略     hermes config
Skill 层    工作方法、行为规则、自动化流程   SKILL.md 审核
输出层      每次对话的输出内容和行为        实时反馈、上下文约束

每一层都是对上一层的补充和细化,越往下越灵活,越往上越刚性。

第一层:输出层——最灵活的边界

控制范围:每次对话的输出内容和行为。

控制方式:实时反馈、上下文约束。

治理原则最小干预——让 AI 有最大的自由度,只在必要时纠正。

# 实时纠正示例
# 用户:"这份报告太长了,我不需要测试细节,只需要安全问题和性能问题。"
# Hermes 会把这个偏好写入 Skill,下次自动调整

第二层:Skill 层——行为准则的边界

控制范围:工作方法、行为规则、自动化流程。

控制方式SKILL.md 审核、版本回滚。

治理原则事前审核 + 事后回滚——Skill 创建和修改需要用户确认,但可以随时回滚到之前的版本。

# 查看 Skill 变更记录
hermes skills history daily_code_review

# 回滚到上一个版本
hermes skills rollback daily_code_review

# 审核待确认的 Skill
hermes skills review-pending