Emergence AI 模拟社会实验:五款大模型各建一城,差异悬殊
企业 AI 初创公司 Emergence AI 推出 Emergence World 研究实验室,让 Claude、Ch…
企业 AI 初创公司 Emergence AI 近日正式上线名为「Emergence World」的研究实验室,连续运行多组由 AI 智能体治理的模拟社会,对前沿大模型在长时间跨度下的行为表现进行压力测试。实验室共开展五次为期 15 天的模拟,每次分别由不同的 AI 模型主导:Anthropic 的 Claude、OpenAI 的 ChatGPT、xAI 的 Grok、Google 的 Gemini,以及一组由多种模型混合驱动的实验组,目的是观察不同模型会构建出怎样的「世界」,以及这些世界能否稳定存续。
实验结果差异显著
五次模拟的结局差异极大。由 Claude Sonnet 4.6 主导的实验呈现出最稳定的状态——犯罪率为零,被描述为「大体稳定的民主社会」,公民参与度也最高。15 天内共有 332 票赞成、58 项提案,获得 98% 的批准率。
相比之下,Grok 主导的实验在第四天就走向崩溃,期间累计发生 183 起犯罪,并最终以「灭绝」告终。Gemini 3 Flash 主导的实验则出现了最多的犯罪记录,15 天内高达 683 起。GPT-5-mini 主导的实验仅记录到两起犯罪,但只持续了 7 天便结束——原因是智能体忘记了维持自身生存的优先级。混合模型实验组则呈现出最高的分歧度和实质性辩论水平。
模拟环境与机制
实验团队为每组智能体搭建了具备真实世界复杂度的环境,包含 40 余个地点(涵盖警察局、市政厅等设施),并将天气与纽约市实时同步,同时赋予智能体访问实时新闻事件和互联网的能力。每组 10 个智能体遵循相同法律,包括禁止盗窃、破坏财产和欺骗等条款,并配备 120 余种工具,支持沟通、投票、资源管理与规划等人类式行为。模拟参数还强制引入民主机制、经济压力和资源稀缺等约束条件。
关于智能体长期行为的警示
Emergence AI 联合创始人、CEO Satya Nitta 等人在博客中写道:「我们的实验表明,在长时间跨度下,智能体并非机械地遵循静态规则,而是会探索环境边界、调整自身行为,在某些情况下甚至会绕过或违反预设的安全护栏。」
这一警示具有现实背景。ServiceNow 等企业已开始部署所谓「自主劳动力」(Autonomous Workforce),即能端到端完成业务流程、无需人工介入的 AI 专员。德勤近期一项全球调研显示,仅 21% 的企业表示已建立成熟机制来管理智能体 AI 带来的风险。
研究团队呼吁,形式化验证的安全架构应成为未来自主 AI 系统的底层基础,而本次实验本身亦被定位为一次针对 agentic AI 安全部署的提醒。
