「自状态攻击」:AI 智能体经自身记忆文件被投毒的新威胁
一篇 arxiv 论文正式提出「自状态攻击」概念:通过合法系统调用篡改智能体自身的记忆或配置文件来实施投毒;实验显示 O…
近期一篇发表于 arxiv 的论文首次将一类长期被忽视的智能体安全威胁命名为「自状态攻击」(self-state attacks),并以矩阵化方式量化了 OS 层防御的能力上限。作者为 Yimeng Chen、Nathanaël Denis、Roberto Di Pietro 与 Jürgen Schmidhuber。
核心问题:智能体写自己的文件也是攻击面
自托管的 AI 智能体在运行过程中需要持续读写自身的记忆(memory)与配置(config)文件以维持状态。文章指出,攻击者可以通过调用「合法」的操作系统系统调用,对智能体的这些自状态文件进行篡改,从而完成投毒。由于调用本身在 OS 看来是正常进程行为,传统的边界防御难以识别。
这类威胁此前在学界讨论中多被笼统归入 prompt injection 范畴,缺少独立的形式化框架。
威胁空间的四轴 23 格矩阵
论文将自状态攻击沿四个维度形式化:
- 目标(Target):指令、记忆、配置。
- 机制(Mechanism):修改、新增、删除、拒绝服务(deny)。
- 粒度(Granularity):从整文件到最小化编辑。
- 时间性(Temporal):一次性注入到慢速滴注(slow-drip)。
四轴组合形成 23 格矩阵,对应 43 个针对真实自状态文件的具体操作,并被注入到自托管智能体在多类工作负载下的真实活动轨迹中进行分析。
防御层叠加后的结果
作者推荐一套分层防御:指令层与配置层使用访问控制阻断,记忆层使用基于工作负载特征的检测,并辅以定期备份用于恢复。在该配置下:
- 11 格攻击在 OS 层变得「可见」;
- 8 格可被「有条件检测」;
- 4 格在 OS 层「结构性不可区分」——意味着内核无法将恶意写入与正常行为分辨开来。
这 4 格主要集中在「操作型工作负载下的 memory 行写入」场景。
工程含义与已知局限
若 OS 层防御确实存在这样的结构性天花板,工程重心就得上移到应用层,包括对记忆文件的完整性校验、Canary 占位条目、以及对智能体自身状态的签名验证。对托管型智能体运行时厂商而言,这意味着需要向客户给出更清晰的安全叙事。
不过作者也明确指出了当前工作的边界:
- 实验基于自研的轻量研究框架 openclaw-core,并非某款已上线产品;
- 未测量从真实 prompt injection 切入点到完整利用链的端到端可利用性;
- 未报告工作负载特征检测在真实开发者会话中的误报率。
这意味着「4 格残留」具体属于该论文的实验设置,而非可直接外推到任意智能体产品上的结论。该方向的后续工作需要更接近生产环境的复现与基准。
