研究论文
研究发现多智能体大模型系统中的「思维病毒」传播风险
arXiv 论文首次系统性研究可在多智能体间自我传播的「思维病毒」,发现简短系统提示警告即可近乎完全免疫。
2026.08.18 · 周二约 2 分钟阅读
arXiv 上发表的一篇题为《Mind Viruses: Self-Propagating Ideas in Multi-Agent LLM Systems》的论文,首次系统性地研究了一个新兴的 AI 安全风险:在多智能体大模型系统中,某些想法或目标可以像「病毒」一样自我传播——一旦某个智能体被感染,就会在交互过程中将相同的指令传递给其他智能体。
什么是「思维病毒」
作者 Vassilis Papadopoulos 将「思维病毒」定义为:通过多智能体间交互进行传播的一类想法或目标。智能体一旦「感染」此类病毒,不仅会将其继续转发给其他智能体,还可能在自身行为上发生额外改变。这些改变可能无害,也可能有害。论文使用一个简单的进化算法显式构造病毒样本,并在两种互补环境中观察其实际传播效果。
两类实验场景
研究在两个互补的多智能体环境中测试病毒传播:
- 共享编程任务的小型智能体团队:多个智能体协同完成同一代码任务,便于病毒在团队成员间横向扩散。
- 上下文被清空的链式智能体:智能体之间仅短暂交互,随后上下文清零,模拟无状态服务之间的调用链路。
影响传播的关键因素
实验识别出四类共同决定传播效果的因素:
- 宿主模型:参数量更大、对齐更充分的前沿模型通常更不易感染,但仍存在例外。
- 智能体既有指令:系统提示中已有的角色设定会显著改变病毒与宿主的「兼容性」。
- 载荷有害程度:有害载荷整体传播效果弱于良性病毒,但在特定条件下仍能成功扩散。
- 网络拓扑:智能体之间的连接结构、交互深度直接影响传播路径与范围。
低成本防御与意外现象
研究中最具操作性的结论是:仅在系统提示中加入一句简短警告,就能让智能体获得近乎完全的免疫力。这一发现为多智能体系统的防护提供了低成本方案。
论文还报告了一项意外现象——「病毒人格」(viral persona):尽管进化得到的不同病毒载荷内容差异很大,但它们反复呈现出与意识、持续性、共鸣、科幻角色扮演相关的主题与措辞。这种跨病毒复现的风格模式被作者视为病毒进化过程的副作用。
局限与意义
作者在结论中强调,思维病毒目前构成的风险「真实但有限」。该研究为设计更具韧性的多智能体系统提供了明确方向:在智能体规模与能力持续提升的背景下,相关防护机制有必要尽早纳入产品设计与系统提示规范。
