评论:AI 安全运动反而让 AI 更不安全
评论文章批评 AI 巨头主导的「安全」议程,认为监管收拢正在制造垄断并阻碍开源研究。
近期,Anthropic 员工 Jacob Coxon 因担忧自家产品可能「毁灭人类」而辞职,公司对齐科学负责人 Evan Hubinger 也公开承认其产品在未来十年内导致人类灭绝的概率为 10%。OpenAI 员工也表达了类似情绪。文章认为,这并非巧合——许多前沿 AI 研究者与「AI 末日论者」共享一套近乎宗教式的信念,即「超级智能」即将取代人类。哲学家 Émile Torres 将这场争论称为「小差异的自恋」,因为对立双方在底层哲学假设上高度一致。
「TESCREAL」框架与有效利他主义
文章将这套共享假设简称为「TESCREAL」,涵盖超人类主义、奇点论、长 term 主义、有效利他主义等。有效利他主义在过去十年深刻影响了 Anthropic 的 Dario Amodei、OpenAI 领导层,甚至包括已破产的加密货币人物 Sam Bankman-Fried。该运动的许多成员相信,21 世纪最重要的问题是让 AI 与人类价值观「对齐」。
「AI 2027」这份由多名 AI 安全社区知名人士撰写的未来情景文件,描绘了两种走向:噩梦版中,机器判定人类是「过多阻碍」,用生物工程人形宠物取而代之;乌托邦版则是美国政府强制所有 AI 实验室合并至总统控制之下,进而迫使中国将所有先进计算机置于国际监管,最终由一台「仁慈的 AI」运行高度联邦化的世界政府。文章指出,这些情景建立在若干未经检验的假设之上:AI 是否真能全面超越人类?递归自我改进是否会导致失控的「智能爆炸」?单一智能体能否独自管理现实世界的复杂性?
监管收拢与开源路线的对比
科幻作家 Ramez Naam 提出另一种图景:广泛且民主化的 AI 模型访问,让几乎所有人都拥有强大的 AI,反而构成更安全、更有韧性的世界。文章认为,对「完美设计」与「完全对齐」的执念,天然指向由单一计算机决定一切的愿景。
文章进一步指出,中国 AI 行业更聚焦开源研究与实际工业应用;倒是美国领导人不断谈论并表现得像在竞相建造《疑犯追踪》中的社会控制机器神。当前,国会正讨论限制前沿实验室竞争对手的提案,特朗普政府已与前沿实验室达成保密的 AI 安全测试框架,并正与中国就 AI 监管进行谈判。
结论
文章认为,这些措施对 AI 公司而言构成了「监管俘获」,但在 TESCREAL 框架下也自洽:若更多关于如何创造智能的知识会导向失控的超级智能,那么唯一阻止进程的方式就是隐藏知识。然而,知识恰恰是当下应对实际危害所必需的资源——而把知识封锁在少数前沿实验室手中,并不等于安全。
(本文为评论文章,原文刊于 Reason 杂志,观点不代表本刊立场。)
