Anthropic 用 Claude Science 平台算出平面 N=4 超对称杨-米尔斯理论九圈六粒子散射振幅,刷新…
理论物理中一项保持了三年的计算纪录,被 Anthropic 的 AI 刷新。该公司宣布,旗下 Claude 在科研平台 Claude Science 中几乎无人监督地连续运行数天,算出了平面 N=4 超对称杨-米尔斯理论中的九圈六粒子散射振幅。这是该模型从 2023 年以来的首次「增圈」,也把研究门槛从「顶级实验室多年筹备」压缩到了「一句任务描述加几千美元」。更关键的是,结果由此前八圈纪录的创造者 Lance Dixon 独立验证。
粒子物理学家预测粒子对撞结果,靠的是「散射振幅」:给定粒子的能量与动量,它给出以某种方式反应的概率。圈数大致衡量相互作用的复杂程度,每加一圈,答案更接近真实值,但计算量呈指数级甚至阶乘级增长。绝大多数散射振幅只算到两圈,电子反常磁矩用到五圈已是粒子物理里最精确的预测。
N=4 超对称杨-米尔斯是这个领域的「玩具模型」:粒子极多但不描述真实世界,恰恰因高度对称让许多变量相互抵消,研究者在此打磨新方法。2023 年 Dixon 与 Yu-Ting Liu 借助「对跖对偶」对称性,先算更易求的形状因子,再换算出八圈振幅。此后几年他的团队一直瞄准九圈,计划沿用同一条间接路线。九圈长期被视为直接计算难以企及的目标。
8 月底,Anthropic 的物理学家 Liam Fitzpatrick 和 Siddharth Mishra-Sharma 联系上前理论物理学家、博主 Matt von Hippel,告知挑战已被攻克。使用的模型为 Fable 5.1,运行在 Claude Science 平台上。Claude Science 是一种「harness」,即在大模型外包裹结构化规则与提示,让它在科研任务中表现更稳定。
研究者只给了一句简短任务描述,此后指导几乎只剩「继续」。披露的一条典型指令大意是:「我要去睡觉了,接下来几个小时不在,继续做,直到我叫停,每四到六小时汇报一次进度。」最终 Claude 用两种方式各算了一遍:直接的自举法,以及 Dixon 团队那条经形状因子的间接路线。
成本构成如下:
9 月 1 日,Dixon 受邀独立验证结果。他写道,对他而言那刻是大语言模型改变物理学「真正落到自己身上」的时刻。让他印象深刻的不是规模,而是流程的脆弱性:整套配方只要任何一步出错,整个结果就会像失败的舒芙蕾一样塌掉;而其中大量构造细节繁琐到不会被写进论文,Claude 必须从零搭建所有代码。
由于从九圈振幅反推九圈形状因子相对容易,Dixon 主要沿这条路线验证。他坦言并不沮丧:他的团队本来就在用定制 Transformer 模型预测更高圈数,提出过「只要机器给出候选答案,就有全套工具去验证」的口号;Claude 解题所用的正是他们多年发展的方法,结果的呈现格式也沿用了团队的既有规范。
验证中 Dixon 的一句评价广为引用:「除了我的合作者之外,Claude 比任何人都更懂我们 2019 年和 2023 年的那两篇论文。」他承认的同时也指出,真正让他辗转反侧的时刻,是模型抢在人类之前提出新的物理原理与洞见的时候。
在 Anthropic 联系 von Hippel 之后几天,中科院理论物理研究所的何颂也找上门来:他的课题组已拿到九圈结果的大部分。9 月 17 日,何颂与 Jirong Jing、Xiang Li 在 Zenodo 公开了一份《六胶子 MHV 振幅直至九圈的符号》数据集,覆盖二圈至九圈的符号数据。
两条路线形成对比:何颂团队同样借助基于 GPT-6 的 AI 辅助,但只用于计算部分约束条件,整体框架由人来搭建;与 Anthropic「一句 prompt 加反复继续」的近乎全自动路线截然不同。Dixon 在附言中自嘲,两周内他先后被「一台机器」以及「人类加机器」抢了先。von Hippel 强调各方氛围友好,接下来 Dixon、何颂及其合作者会发表这些结果,并做详细解释。
von Hippel 是在 8 月 7 日发出挑战的。他在博客 4gravitons 上点名 AI 公司:用学术圈能负担的算力,去解决散射振幅领域的悬而未决大问题——要么把 N=8 超引力算到七圈,要么把 N=4 超对称杨-米尔斯六粒子振幅算到九圈。他在文中亲自选定后一项,正是他与 Dixon 等人合作推进过的题目。
复盘时他的结论很坦诚:Claude 用的是已知方法,只是比人类此前愿意投入的算力多了一些;它可能受益于用 Python 而非物理学家惯用的 Maple 或 Mathematica,软件工程实践也较规范,但并未到「超级智能」程度。何颂团队几乎同步抵达也说明,这个目标对人类而言并非遥不可及。
他由此得到的最大体会是:哪怕目标简单明确,专家眼中遥不可及的事情,实际可能没那么难,低垂的果实比预想多。但他同时强调另一面:这类计算琐碎而混乱,由他本人用 96 个 CPU 跑一周几乎必然因出错拖成两周,而 Claude Science 在几乎没有科学监督的情况下一次跑通,没有依赖任何外部合作者输入。
他还做了纵向对比:今年 3 月 Anthropic 发布的「vibe physics」实验中,AI 做物理项目还像学生,需要大量手把手指导、错误频出;半年后,它完成的是振幅领域顶尖专家才会去碰的前沿计算。他不排除这恰好是一个特别适合 AI 的问题,但判断技术本身确实变强了。
至于能否推广到面向真实世界的振幅计算,von Hippel 保持谨慎:这类玩具模型通常只属于很小的研究圈子,竞争激烈之处低垂果实更少。但他提醒研究者:若还没试过让 AI 科研平台一次性冲击前沿计算,就该试试了,并同时准备好验证方案。他不会太意外有人能在合理预算内再多挤出一圈。
把这件事放回 9 月的语境,更值得玩味。9 月 8 日,OpenAI 宣布其未公开模型调动上万个 AI 智能体,给出纳维-斯托克斯方程存在性与光滑性的一个反例——即千禧年大奖难题之一,但动用算力远超常规。与「大兵团作战」相比,九圈振幅的故事朴素得多:一个商用科研平台,一句任务描述,几千美元,几天时间。正因朴素,它可能更值得学术界关注。von Hippel 坦承,原本希望借这次挑战一窥未来,看到某种前所未见的计算新方法,从而在超级智能争论中获得依据;但他得到的答案是,自己对极限在哪里的认识过于天真。Dixon 留下的那个问题仍悬着:当大模型不再只是执行人类写好的配方,而是先于人类提出新的物理原理时,物理学家该如何自处?