SkillEffect:为智能体工具引入带内存检查的降级执行框架
arXiv 提出 SkillEffect 运行时,通过独立检查器对智能体工具调用进行降级重建与内存边界审计。
当大模型智能体(Agent)把自然语言描述的"技能"翻译成调用既有工具的程序时,即使语义正确,也可能在一次工具调用内把整个输入加载进内存,从而超出运行时可用的内存上限。arXiv 新论文《SkillEffect: Checked Lowering for Memory-Bounded Agent Tools》针对这一痛点,提出了一种带检查的降级执行(checked-lowering)架构。
核心思路:把内存边界纳入工具分派环节
SkillEffect 的关键设计,是把"内存关系"变成工具调度时的一等公民。每一种被支持的计算都需要声明三个要素:
- 可恢复的源关系(recoverable source relation):描述输入数据的结构与来源;
- 经过审计的有界实现(audited bounded implementation):保证执行过程不会越过设定的内存上限;
- 已注册的后置条件(registered output postcondition):约束输出的形式与语义。
在真正授予执行权限之前,系统会由一个独立检查器(independent checker),根据模型提交的"程序"和不可变输入,重新构建一次完整的降级路径(lowering),相当于做一次形式化的"复算",确保声明与实现一致。
插件结构与共享运行时
SkillEffect 的通用性来自架构而非自动化:每接入一种新的计算,都需要编写一个"关系插件",而调度、资源控制、执行、发布等机制则在所有插件间共享。一个完整的插件包含:
- 源识别器(source recognizer);
- 输入事实抽取器(input-fact extractor);
- 有界中间表示构造器(bounded-IR constructor);
- 受 arena 约束的函数(arena-bound function);
- 输出后置条件(postcondition)。
共享的公共运行时则负责带检查的选择(checked selection)、有界虚拟机执行(bounded-VM execution)、原子化的容量租借(atomic capacity leasing)以及分阶段的结果发布(staged publication)。这种"插件 + 共享运行时"的拆分,使得新关系与新保留状态模式可以复用同一道信任边界。
实验覆盖与验证结果
论文在六个运算符族(operator families)上评估了有界访问的效果,覆盖五种执行模式,从流式归约(streaming reduction)到有界堆的 Top-k。在外部固定的内存上限下,有界访问显著降低了峰值内存,并在容量约束下提高了任务完成率。
额外的两个案例进一步验证了架构的可扩展性:
- XLSX 接入研究:新增一种数据关系,验证无需改动信任边界即可扩展;
- Top-k 扩展:演示一种新的保留状态模式同样落在同一审计框架内。
安全性方面,检查器在所有被评估的合法配置上都予以通过,在所有对抗性提案上都予以拒绝,验证了所提出信任边界的有效性。整体结果表明,同一套 checked-lowering 架构可以在 Agent 工具分派时,统一强制多种异构的、已注册的内存关系。
