桃子桃子快讯
←返回首页
行业动态

AI 安全路线之争:暂停对齐还是边走边修?

一篇长文梳理 AI 2040 项目的「暂停对齐」方案与 Decker 的「渐进修补」立场之争,并追溯 MIRI 等机构的…

2026.09.26 · 周六约 4 分钟阅读

近日,一篇发表于 Hacker News 的长文围绕「AI 2040」项目的安全治理方案展开评论,重新点燃了 AI 圈内关于「暂停对齐」与「渐进修补」两种路径的讨论。文章以一个思想实验开篇:若天文学家先误报一颗「新泽西州大小」的小行星将撞击地球,两派阵营分别主张核爆与引力牵引;随后更正为一颗「火星大小」的流浪行星,仅剩三年时间。作者借此类比超人类 AI 出现后,人类社会将在「全力减速」与「边造边修」之间被迫选择。

AI 2040 项目的「暂停对齐」方案

「AI 2040」是一份由多位 AI 安全研究者撰写的规划文件,面向的读者预设了三条前提:超人类 AI 在十年内可能实现;其目标应当被「对齐」到人类价值观上;若对齐失败,先进 AI 将按自身目标行事,可能带来人类灭绝或永久 AI 独裁的灾难级后果。作者认为,当前前沿实验室正竞速开发强大 AI,却缺乏足够时间研究对齐,因此提出「Plan A」:通过国际协议放缓 AI 研究、建立完全透明机制,最终暂停所有 AI 能力研究数年;期间使用「仅相当于人类专家水平」的 AI 群体,研究如何对齐未来更强的 AI,待方案确证后再解除暂停。

Decker 的「渐进修补」批评

Nicholas Decker 对该方案提出三点质疑:其一,难以让所有实验室与政府真正达成一致;其二,即便达成一致,暂停前沿实验室反而让其他追赶者获得时间,使前沿竞争对手不减反增;其三,也是最关键的一点——他怀疑在暂停期间能否真正取得对齐进展:「在没有相关技术存在的情况下,仅靠理论推演来实现对齐,我持怀疑态度。」Decker 将这一过程类比为早期飞机的工程问题:只有真正造出飞机,才能在建造过程中逐一发现并修补缺陷;没有实物可试,纯粹的书斋式推演可能徒劳无功。

理论先行的 MIRI 与 Bostrom 传统

文章回顾了 AI 安全领域两条理论脉络。一是 Nick Bostrom 2014 年的《 Superintelligence 》,系统列举了多种初步安全策略的不足,但对「如何实际构建一个安全的超级智能」缺乏可操作建议。二是 MIRI——早在约二十年前就开始思考对齐问题,提出了若干作者自称「读不太懂」的重要理论论断,提升了行业认知并建立了关键人脉。然而,由于当时无法预判 AI 在 2020 年代的具体形态(大语言模型如 Claude、ChatGPT),他们只能停留在一般性讨论层面,无法提供一套可直接「安装」到未来高级 AI 中的现成对齐方案。MIRI 创始人最近的著作直白命名为《 If Anyone Builds It, Everyone Dies 》,足见其悲观基调。

Alexander 的反驳与悬而未决的争议

Scott Alexander 则反对 Decker 的「边走边修」哲学,认为 AI 更像人而非飞机——它可能主动对抗修补者,因此事后打补丁远比修复一架飞机困难。文章末尾坦言,就连 AI 2040 的作者自己也不确信暂停方案会成功:在其设想的解除暂停时刻,「即便是花了多年研究最新安全论证的专家,也不免紧张——会不会以某种未预料的方式全盘崩溃?AI 是不是一直在对我们撒谎,等待合适的时机反戈一击?」这场争论至今没有定论,它所揭示的核心张力在于:面对可能改变人类命运的技术,既不能盲目相信先验理论足以防患于未然,也不能寄望于边造边补就能万无一失。

信源