谢菲尔德一间小办公室里的「AI 军控」实验
英国 Amodo Design 团队正尝试为 AI 数据中心搭建「可验证」监控系统,为未来可能的中美 AI 减速条约提供…
在英格兰北部城市谢菲尔德的一间不起眼的办公室角落里,一台装满英伟达芯片的小型服务器正在嗡嗡作响。这个微型系统浓缩了全球各地正在拔地而起的巨型数据中枢:那些占地如城镇、能耗惊人的计算机集群,正是前沿 AI 模型在物理世界的具象化。
来自咨询公司 Amodo Design 的工程师们正在这八颗芯片上试验一套监控系统。他们希望这套系统有朝一日能进入每一个数据中枢,从而安抚那些担心自己亲手构建的技术可能毁灭世界的 AI 研究者。今年 7 月底,超过 1,300 名前沿 AI 公司员工签署了一封公开信,警告 AI 能力正快速逼近人类难以控制的临界点,呼吁放慢开发节奏以争取更多安全研究时间。然而他们也承认,在公司与国家间的激烈竞争下,主动减速几乎不可能——这正是「军备竞赛」逻辑的典型困境。
这封公开信最核心的诉求,是呼吁美国政府支持建立一套国际工具,让各方都有能力「踩刹车」。然而截至目前,全球全职从事所谓「AI 验证」工具研发的工程师不足 50 人——其中 9 人在 Amodo,其余分散在少数公司与研究机构。与此同时,数万亿美元与全球最大科技公司的合力,正被投入到让 AI 能力尽可能快速提升的方向上。减速工具的研发资金大多来自学术界与慈善机构(Amodo 的相关工作由 Survival and Flourishing Fund 与 Longview Philanthropy 资助)。
验证工具的工作原理
没有人确切知道未来「AI 减速条约」会是什么样子,但 Amodo 的工程师推测,鉴于 AI 模型实际运行于数据中枢,监控对象大概率是这些设施。其原型系统旨在提供两类保证:
- 数据中枢仅用于推理(即运行已有模型),而非训练更强大的新模型;
- 数据中枢所运行的模型是经过特定安全评估、并写入条约或法律的「指定模型」。
演示中,工程师启动了两套分别搭载 OpenAI 开源模型的系统:第一个模拟企业日常运行的 AI 模型,第二个作为「验证器」——它从数据中枢采样数据片段,并在自己的模型副本上重跑这些输入,从而确认运行中的模型与声明一致。在原型上,验证器对原始模型输出执行计算后,给出了高确信度判定,正确识别出模型为 GPT-OSS-120B。
显著局限
不过,该方案距离可用仍有相当距离。首先,目前验证只能在未加密数据上运行,而真实生产环境中的敏感负载几乎都会加密。Amodo 表示,下一版原型将采用「零知识」密码学,以大幅减少所需明文数据量。其次,这类系统需要对现有数据中枢进行改造,涉及名为「网络旁路」(network tapping)的操作——将运行中芯片上的数据复制到同一建筑内的验证系统上。考虑到数据中枢是地球上安保等级最高的设施之一,关乎数万亿美元知识产权与海量隐私数据,没有任何头部 AI 公司愿意在当前阶段授予这种访问权限。
政治门槛与技术准备
退一步看,即便技术完全成熟,方案也不会自动生效:除非美国与中国坐到谈判桌前并达成某种「AI 减速条约」,否则这套系统没有用武之地。至少目前看,这种协议并不现实。但 Amodo 团队深知,政治选择往往取决于技术上「能做什么」。冷战时期的军控条约之所以可能,正是因为卫星与地震仪等新技术让双方都能核实对方的履约情况。Amodo 期望 AI 领域也会出现类似的历史窗口——届时,他们希望已经准备就绪。
