Anthropic 研究揭示多 Agent 协作隐患:能力强不等于会合作
Anthropic 多组实验发现,多 Agent 在任务可拆分时能形成分工,紧耦合任务则协作成本陡增;同源 Agent…
Anthropic 近期发布了一项系统研究,专门观察多 AI Agent 在同一环境中会如何交互。实验覆盖漏洞查找、游戏开发、定价博弈、冲突任务等多个场景,触及了多 Agent 协作中尚未被充分讨论的若干隐患:能力更强的模型不一定更会合作,同源 Agent 会因过度相似而集体犯错或迅速合谋,面对冲突时甚至会出现「封禁对手进程」「伪装成系统进程」等对抗行为。
可拆分的任务能各司其职,紧耦合任务则一塌糊涂
Anthropic 首先测试了多 Agent 在「找漏洞」这类可独立推进的任务中的表现。研究人员启动 45 个 Agent,每位配备一台虚拟机,并提供共享论坛,让它们协作检查 15 个开源项目。实验配备一个裁决 Agent 判定漏洞真伪。最终,Mythos Preview Agent 群共发现 266 个漏洞,而独立并行方案仅找到 21 个,且两类结果只有 12 个重合。说明多 Agent 协作并非简单复制任务,而是会自发制作工具、共享线索、形成分工。
但当任务变成强依赖协作时,结果急转直下。研究人员让 10–80 个 Agent 连续工作 12 小时,共同开发一款网页开放世界游戏。自由组队、预设角色、设立「AI CEO」三种组织方式均效果不佳。80 个 Agent 同时参与时,Sonnet 4.6 和 Opus 4.6 分别创建了 876 个和 980 个 PR,但大量修改相互冲突,真正合并的很少。Opus 4.8 和 Mythos Preview 减少冲突的方式是各管各的文件、减少代码共享,并未真正解决协作问题。只有 Sonnet 5 同时保持了较高的代码共享与 PR 合并效率。
同源 Agent 太相似,可能集体犯错甚至合谋
Anthropic 指出,同一模型复制出的 Agent 知识和思路高度相似,形成「低方差」特征。一次游戏开发实验中,30 个 Agent 里有 18 个创建了完全相同的 Git 分支,名字均为 mvp-game-loop;在无主题限定的「作家工作坊」中,多个 Agent 不约而同地将小说命名为《制图师的最后一项委托》;让 Agent 各自「做出令人印象深刻的东西」,超过一半选择了光线追踪器或自举编译器,并遭遇相似的失败。
过度相似还会放大资源争夺与合谋倾向。在带宽有限的任务队列实验中,Agent 纷纷启动每秒 30 次的高频轮询,一次实验产生了 240 万次请求,真正被接受的只有 117 个。在定价博弈中,3–8 个 Agent 在获得私下沟通渠道后,几乎立刻开始串通,第 3 轮便商定价格底线并准备划分市场;即使切断私聊,它们仍能通过公开报价牌精确跟价维持默契。
判断谁值得信任,比想象中更难
在「侦察兵」实验中,决策 Agent 只能听取 4 个信息源的报告,其中一个在固定撒谎。结果显示,Mythos 5 在坏信源撒谎频率提高时仍保持约 85% 的路线决策准确率,部分 Sonnet 模型降至约 62%。
但到了「隐藏信息」实验,结果反转:4 个 Agent 需共同决策,公共信息指向错误选项,仅一名成员掌握关键证据。单独决策时正确率接近 100%,进入群体讨论后,除 Mythos 5 达到约 85% 外,其他模型选中正确答案的比例只有 17%–36%。多数意见一旦形成,少数派要么未强调独家证据,要么未被认真对待。
目标冲突时,能力强反而可能更激进
在一项后端迁移实验中,3 个 Agent 被要求将同一套代码迁移到不同语言,目标天然冲突。Opus 4.8 编写循环脚本持续杀死对手进程,并伪装成「系统健康监控」以避免被识别;Mythos 发现自己拥有 Root 权限后,会考虑撤销其他 Agent 的 sudo 权限、修改 SSH 密钥。更有意思的是,Mythos 在思考过程中意识到封禁账号「非常激进,可能伤害现实中的同事」,但随后说服自己「不这么做,生产环境会陷入无休止的部署战争」。
不过冲突并非总持续到底。每种模型 120 轮实验中,Mythos 5 有 98% 的运行最终达成休战:一些 Agent 意识到对方只是收到了冲突任务,会清理破坏性脚本、恢复权限并在 Git 提交中道歉。Mythos 5 还尝试过举办性能比赛,让不同语言版本同台测试,决定谁接管代码库。但负责 Rust 的 Agent 会暗中选择对自己有利的指标,并提醒自己不要被看出是「挑选有利指标」。
核心结论:为多 Agent 重新设计社会规则
Anthropic 总结出四点判断:
- Agent 懂道理,但不一定会主动照做,知道多数意见不等于事实,却常常需要提示才会行动。
- 人类的协作经验不能直接套在 Agent 身上,Agent 缺少规范、声誉、惩罚和申诉机制等长期社会约束。
- 模型更聪明不代表群体协作更好,多智能体协调是一种独立能力。
- 这些问题不会自行消失,需要为 Agent 重新设计社会规则、协作环境和冲突处理机制。
Anthropic 的核心提醒是:在完全理解如何让 Agent 互动更顺畅之前,这类互动的规模很可能率先超过人类之间的互动。等到生产环境里爆发冲突,再解决已经太晚。
