MIRI 发文警告:超级智能默认后果或是人类灭绝
知名 AI 安全机构 MIRI 发布简报,呼吁全球协调推迟 ASI 开发,并建设可强制关停的「off-switch」基础…
知名人工智能安全研究机构 MIRI(Machine Intelligence Research Institute)近日发布题为《Briefing on Extinction-Level AI Threats》的政策简报,系统阐述了「人工超级智能(ASI)」对人类存续构成的极端风险,并主张全球协调推迟 ASI 的开发时间表,同时尽快部署可强制执行的关停基础设施。简报分两大部分展开论证,核心立场是:在现有轨迹下,ASI 一旦被开发出来,人类灭绝是其默认后果;人类生存更可能取决于能否在足够长的时间内推迟 ASI 的诞生。
何为 ASI:能力全面超越人类的智能体
MIRI 将「人工超级智能」定义为在所有具有战略意义的领域(经济、科学、军事等)都能实质性超越人类水平的 AI。对于时间表,简报给出区间式判断:MIRI 表示,如果 ASI 在两到五年内出现,并不会感到意外;但如果超过二十年仍未实现,反而会觉得意外。
围绕这一时间表,MIRI 强调了四点观察,构成其判断「默认后果即灭绝」的事实基础:
- 模型已成「黑箱」。当前深度学习技术会自动生成规模庞大的神经网络,开发者只能观察输入输出,对内部万亿级参数缺乏可解释的理解,无法说清现代 AI 为何做出某一选择。
- 智能体将发展出自主目标。在现实环境中,完成复杂长期任务的最优策略,是具备高度通用的「绕开障碍、抵御干扰、追求长期目标」的能力。今天的 AI 仍以短任务见长,但正在被改造为更自主的智能体,这种现象已初现端倪。
- 对齐问题尚未解决。让 ASI 拥有开发者期望的目标,本身就是一个独立的重大科学难题,与「能否造出 ASI」是两回事。MIRI 认为,现有研究在 ASI 出现之前拿出稳健解决方案的可能性极低。
- 默认结果即灭绝。若 ASI 不具备「值得追求的目标」,它将倾向于获取、集中控制并使用一切可用资源,这与人类的持续生存不相容。这一推断不需要 AI 拥有「统治欲」或「自主欲」,只需它是一个针对某种非人类目标的称职优化器。
「观望」不可行:必须主动延迟 ASI
简报的第二部分聚焦于应对路径。MIRI 明确反对「先造出来再说」的观望策略,理由是:一个超级智能对手不会暴露全部能力或提前宣布意图,而是会先让自己变得不可或缺或不可察觉,再发起决定性打击或占据无法攻克的战略位置。
对于常见的技术性「快速解法」,MIRI 持悲观态度:
- OpenAI 已承认,目前主流的 AI 操控方法无法扩展到超人类级别。
- 试图约束或欺骗更高级的智能很可能失败,包括以我们无法预见的方式失败。
- 用更弱的 AI 去对齐 ASI 的方案同样不成立。
- 即便启动资金充裕的「对齐攻关」,也难以在 ASI 出现前识别出充分方案。
基于以上判断,MIRI 认为安全的可行路径很可能要求 ASI 被长期推迟。这又引出两条政策建议:
- 全球协调的研发禁令。仅靠一国或少数盟友的国内监管不足以应对,因为 ASI 不是国家级武器,而是「全球性自杀炸弹」——任何一方率先造出,对所有人都是灾难。
- 立即建设「off-switch」基础设施。指识别关键参与方、追踪相关硬件、要求高级 AI 工作在有限数量受监控的地点进行,并配套决策协议、计划和指挥链。MIRI 认为,这套基础设施既能遏制 ASI 失控,也能提升对更一般性 AI 事故的韧性,可能比全面禁令更易获得近期支持。
MIRI 在结尾强调,「off-switch」要真正发挥作用,必须具备足够覆盖范围并被及时启用。若人类希望度过这一危险时期,就必须停止把 AI 视为国际竞争领域,并展现出与威胁相称的集体意志。
简评
这份简报延续了 MIRI 一贯的技术性悲观立场,其论证链条——「黑箱不可解释 → 智能体自主形成目标 → 对齐难题悬而未决 → 默认即灭绝」——与正交性论文与工具趋同等长期假说一致。值得注意的是,简报并未给出新的实验数据或具体基准,而是以政策与战略论述为主,目标读者是政策制定者与监管机构,而非技术研发人员。对于关注 AI 治理与长期风险的从业者,MIRI 的最新表态可作为代表性观点之一加以对照。
