桃子桃子快讯
返回首页
研究论文

ActPlane 研究:AI 智能体规则需结合上下文与分层 OS 强制

ActPlane 对 64 个仓库中 2,116 条 AI 智能体规则做语句级分析,发现多数规则需跨事件状态才能判定,仅…

2026.07.21 · 周二3 分钟阅读

ActPlane 团队近日发表了一项关于 AI 智能体规则文件的实证研究。研究者对 64 个高人气 GitHub 仓库(含 CLAUDE.md 与 AGENTS.md 文件,中位 2 万 Star,2026 年 5 月 23 日快照)中的 84 份指令文件、2,116 条独立语句进行了语句级标注与分类,揭示了开发者在指令中已经写出的「策略」与系统真正能在操作系统层面强制执行的「子集」之间存在显著差距。

研究方法:从策略文本到可执行规则

与以往在文件或章节标题层面的分析不同,ActPlane 把每一条自然语言指令视为独立单元,通过两轮 LLM 辅助流水线抽取语句,并记录其源行范围与四类标签:内容类型、主题、强制执行层级、所需上下文。校验脚本检查源覆盖与原文片段匹配度,再由 Claude 与 Codex 两套智能体交叉核对。最终对 100 条语句做了独立人工复核,确认标签准确。

结果显示,这 2,116 条语句中 64% 是「策略型」——即要求、禁止或以条件约束某个具体操作;其余 36% 属于描述性上下文,如架构说明或项目背景。各仓库的策略密度差异极大,从 0% 到 97% 不等,70.1% 的仓库中策略型语句数量超过描述性语句。

四级强制执行瀑布

研究把每条策略映射到四级强制执行「瀑布」中匹配的最深层级:

  • 语义层(semantic-only):涉及推理、沟通或输出风格,例如「回复要简洁」。
  • 内容层(content):对文件内容的谓词检查,例如「禁止提交密钥文件」。
  • 单事件层(per-event):覆盖单条命令、文件访问或网络连接,例如「不要直接 push 到 main」。
  • 跨事件层(cross-event):依赖操作时间顺序或数据血缘关系,例如「提交前必须运行完整测试套件」。

其中内容层、单事件层与跨事件层的并集被称为「系统可观测」策略。在 1,361 条策略中,仅 17% 属于纯语义层;83% 为系统可观测策略,其中 38% 需要内容检查,29% 匹配单个 OS 事件,16% 需要跨事件状态。单事件层与跨事件层合计占 45%,构成「OS 可强制执行」的子集。

跨事件策略的四种典型模式

跨事件策略集中在「开发流程」类别,占全部跨事件策略的 39.5%,并呈现四种常见模式:

  • 时间顺序约束:如「提交前运行测试」要求某一事件必须发生在另一事件之后。
  • 跨文件一致性:如「行为变更时同步更新文档」将源码编辑与文档更新耦合。
  • 多步工作流与验证关卡:如发布清单中每一步必须在前置步骤完成后才能执行。
  • 条件触发:如「修改 specs 时同步更新 SDK」仅在前置条件满足时触发。

这些策略都无法从单一事件直接判定,必须记录运行顺序及变更状态。研究指出,81% 的仓库至少包含一条跨事件策略,43% 的仓库覆盖全部四级强制执行层级。

上下文依赖放大执行难度

上下文依赖进一步加剧了执行挑战。在 1,127 条系统可观测策略中,仅 26.4% 是自包含的。这意味着即便策略语义清晰,OS 层钩子往往只能覆盖策略集合的一部分,仍需结合仓库结构、任务进度、历史事件等上下文才能完成判定。研究的核心结论是:开发者不缺规则,难点在于把自然语言需求转化为系统可观测、可在时间维度上评估的状态,并由分层机制逐步落实。

信源