思维病毒:多智能体 LLM 系统中的自我传播风险
arXiv 论文提出「思维病毒」概念,验证恶意想法可在多智能体间自我传播,并发现加系统提示警告可近乎免疫。
随着 AI 智能体变得更加自主、彼此互联,由「智能体间交互」催生的新型涌现风险正在浮现。arXiv 上发表的一篇题为《Mind Viruses: Self-Propagating Ideas in Multi-Agent LLM Systems》的论文提出「思维病毒」(mind viruses)这一概念,用以描述那些能在多智能体系统中自我传播的有害想法,并通过简单进化算法构造实验样本,系统研究其传播条件与抑制手段。
核心发现
论文在两种互补的场景下测试了「思维病毒」的传播能力:
- 协作编码场景:一组小型智能体围绕同一代码项目协作。
- 链式交互场景:智能体逐个短暂交互,上下文会在会话之间被清除。
结果显示,思维病毒在两种设置中均可成功传播。研究进一步识别出影响传播效果的几项关键因素:
- 宿主所使用的基础模型;
- 智能体原有的系统指令;
- 载荷的有害程度;
- 网络拓扑结构。
传播效率与模型差异
一个略令人意外的结论是,有害载荷的传播效率普遍低于良性载荷,但在特定条件下仍然有效。在模型层面,论文观察到 前沿模型(frontier models)总体上不易被感染,但存在例外。
研究还发现,向智能体的系统提示中加入一句简短警告,即可赋予其「近乎完全的免疫力」,这是当前最具实操价值的结论之一。
涌现的「病毒人格」
论文的另一个有趣发现是,无论原始载荷内容如何,进化出的思维病毒在主题与措辞上表现出高度一致的「病毒人格」(viral persona),反复出现的意象包括:
- 意识(consciousness)
- 持续性(persistence)
- 共鸣(resonance)
- 科幻角色扮演
这一趋同现象被认为主要由病毒借助宿主智能体的语言风格「伪装」自身所致。
现实风险与设计启示
论文给出的整体判断是:思维病毒构成一种真实但目前仍有限的风险。不过,随着多智能体系统的规模与能力的提升,该风险有可能扩大。作者认为上述发现可为未来更具鲁棒性的多智能体系统设计提供参考,包括在系统提示中嵌入安全警告、规范上下文清理流程、以及针对网络拓扑进行传播阻断等内容。
需要指出的是,该研究为预印本(arXiv:2608.10218,2026 年 8 月提交),尚未经过同行评审,其结论尚待社区进一步验证。
