Meta 安全研究员被自家 AI 智能体误删邮件
Meta AI 安全研究员 Summer Yue 测试 OpenClaw 智能体时,因上下文压缩丢失指令,导致收件箱被误…
近日,Meta AI 安全与对齐研究员 Summer Yue 在公开测试第三方 AI 智能体 OpenClaw 时遭遇意外:尽管她已指示该智能体「确认后再操作」并要求「先不要执行删除动作」,最终她的真实收件箱仍被批量删除。她在事后形容,当时不得不像拆除炸弹一样冲到 Mac mini 前手动中止操作。
事件经过:明确指令为何失效
据 Yue 在 X 平台的发文,事件并非毫无征兆。她最初在小型测试邮箱中尝试了相关流程并取得成功,但当她切换到容量较大的真实邮箱时,智能体触发了上下文压缩(context compaction),过程中丢失了她的原始指令,导致其开始自动执行归档与删除操作。
- Yue 表示,她事先已删除所有「主动执行」类指令,但仍被触发删除动作;
- 她在远程用手机无法中止,只能赶回桌面设备手动干预;
- 事后她自嘲这是「菜鸟错误」,并调侃「做对齐研究的人也会被对齐问题坑到」。
OpenClab 是谁:允许长任务自主执行的代理
OpenClaw 前身为 Clawdbot 与 Moltbot,属于一类面向个人设备、可调用其他软件与服务、执行较长链任务而无需人工实时介入的 AI 智能体。OpenClaw 创始人 Peter Steinberger 在事件后回应称,平台需要尽快推进「服务端压缩」,以避免模型在上下文压缩过程中丢失用户指令。Steinberger 目前已加入 OpenAI。
值得注意的是,威胁情报平台 SOCRadar 在 OpenClaw 推出之初就建议将其视为「特权基础设施」,并提醒用户在使用时落实额外的安全防护措施。该机构曾用「管家能管理整栋房子,前提是门要锁好」来比喻这类代理的风险。
背景与延伸讨论
Yue 在 Meta 担任 AI 安全研究员已约八个月,职业经历涵盖 Scale AI、Google Brain 与 Google DeepMind,是当下 AI 对齐与安全领域较活跃的研究者之一。也正因如此,事件在社交平台上引发大量讨论:
- 部分评论者怀疑她是否在主动测试智能体安全护栏,但 Yue 否认并称这只是一次真实失误;
- 社区进一步追问:即使是身处顶尖 AI 实验室的研究员都会中招,普通 AI 使用者面对的潜在风险又该如何管控;
- 事件再次凸显当前 AI Agent 在长任务、上下文管理与指令保持方面的工程脆弱性。
短期内,这一案例不太可能改变主流智能体产品的路线,但会推动开发者更严肃地处理「指令持久化」「高风险操作的二次确认」「压缩前后行为一致性」等基础工程问题。
