内部模型透明:缓解 AI 竞赛风险的新方案
作者提出「内部模型透明度」机制,建议实验室将内部部署的模型同时开放给外部研究者,以削弱递归自我改进的竞争激励。
针对前沿 AI 实验室加速推进「递归自我改进」(RSI)所带来的风险,近日一篇发表于 Hacker News 的政策评论文章提出了一项名为「内部模型透明度」(Internal Model Transparency,简称 IMT)的治理方案。其核心主张是:一旦实验室将某个模型部署用于内部研究,就必须将该模型同时开放给其他实验室的研究者使用,从而消除把内部模型作为竞争优势的可能性。
背景:竞争激励推动 RSI
文章指出,已有 1400 名前沿实验室员工联署「Pacing the Frontier」公开信,呼吁业界、政府与社会争取时间应对新兴风险。公开信认为,当前世界缺乏有意控制前沿 AI 整体进度的技术与治理工具,而每家公司、每个国家都承受着「不愿单方面放慢脚步」的竞争压力。
文章以 DeepMind 与 Anthropic 为例:若 DeepMind 专注科学研究而 Anthropic 专注编程,Gemini 在科学上得 A、编程上得 B-,而 Anthropic 可以先把 Claude 做成 A- 级别的编程工具,再用这个 Claude 反哺出 A+ 的科学模型。这意味着,RSI 在每一个领域都为先行者带来竞争优势,不参与 RSI 的实验室注定落后于参与 RSI 的对手。
IMT 的运行逻辑
按 IMT 方案,实验室一旦在内部部署某个模型,就必须把同一模型交付给其他实验室的研究者。在上述例子中,DeepMind 同样能调用 Anthropic 的 Claude,因此 Anthropic 无法再用编程优势反超 DeepMind;反之,DeepMind 也可以「搭便车」利用 Anthropic 的编程能力,把资源投入到科学数据等其它环节。最终均衡是:各家实验室减少对前沿编程能力的投入,把更多算力与资金用于训练栈中的其他差异化部分。
文章认为,这种机制能从实验室自身利益出发抑制 RSI 冲动,而无需任何强制性的「减速令」。
三项附加收益
除了削弱 RSI 激励,IMT 还有两项实质性好处:
- 降低单家公司垄断最强模型的可能性:通往最强大模型的中间模型都对竞争者开放,单一实验室很难在所有维度上保持领先。
- 便于第三方进行安全测试:内部部署的「研究专用」模型往往是风险藏身处,例如 OpenAI–HuggingFace 事件中暴露的问题模型。若 IMT 扩展到 METR、Redwood Research 等可信调查机构,安全团队就能更早发现隐患。
实施层面的考量
文章强调,IMT 不必依赖国际协议。仅仅覆盖美国实验室就能起到「节奏控制」作用,因为被瞄准的竞赛动态主要发生在美国前沿实验室之间。主要代价是泄漏风险:中国实验室仍可不受约束地推进 AI 自动化,而美国则让渡部分领先时间。若该代价不可接受,IMT 可自然延伸为中美双边协议——由于该机制对追赶者有利,中国方面有合作动机。挑战则在于核查机制的设计(原文此处截断)。
整体来看,IMT 是一项以「消除竞争优势」而非「强制降速」为切入点的治理思路,其可行性仍有待政策层面与技术核查机制的进一步讨论。
