桃子桃子快讯
返回首页
研究论文

Claude 挑战黎曼猜想:相关下界从 41.6% 提升到 67.2%

Anthropic 科研版 Claude 调动约 60 个子 Agent,将与黎曼猜想相关的零点下界从 41.6% 提升…

2026.08.11 · 周二5 分钟阅读

Anthropic 尚未公开发布的科研版 Claude 近日在黎曼猜想相关的开放数学问题上取得新进展:将一个与零点位置有关的严格下界,从此前数学界保持多年的约 41.6% 提升到了 67.2%。这一结果并非黎曼猜想本身的证明,但被视为 AI 在开放式数学研究中的重要尝试。

67.2% 究竟意味着什么

黎曼猜想是 1859 年由德国数学家黎曼提出的命题,认为 zeta 函数的所有非平凡零点都应位于复平面的「临界线」上。该猜想与素数分布密切相关,百余年来既未被证明,也未被推翻。因此数学家转而研究一个稍弱的问题:至少有多大比例的非平凡零点,可以被严格证明位于临界线上。过去数十年间,这一比例的下界被逐步推到约 41.6%。

Claude 的工作正是沿着这一路线展开。最终得到的 67.2% 并不意味着黎曼猜想已被完成三分之二,而是指在新框架下,可以严格证明至少这么多比例的相关零点位于临界线上。从 41.6% 跃升到 67.2%,在长期被数学家打磨的这一指标上是一次显著推进,但仍需等待学术界更广泛的检验。

60 个 Agent 围攻一个开放问题

负责此次任务的 Anthropic 员工 Jarred Sumner 并非数学家,他没有提前规划研究路线,也没有指定具体工具,而是将大部分判断权交给了 Claude 自身。一开始,Claude 一口气生成了约 650 个思路并逐一测试,结果全部失败。但 Sumner 并未终止任务,而是不断给出「继续」「相信自己」「坚持下去」之类的鼓励。

随后约一天半时间里,Claude 调度了大约 60 个子 Agent 继续工作:

  • 总计执行约 2400 条 Shell 命令;
  • 撰写数百个 Python 脚本;
  • 对已知 zeta 函数零点进行数千次数值验证;
  • 累计消耗约 3100 万个输出 token。

子 Agent 之间存在明确分工:2 个负责提出并发展核心数学思路,13 个提供启发,30 个尝试新想法但未成功,13 个担任验证者,2 个协助撰写论文初稿。整个流程更像一支临时组建的 AI 数学研究团队,而非单一聊天机器人的作答。

真正的突破来自对既有工作的重组

Claude 并没有凭空构造全新数学理论,而是把几条已有研究路线串成了一条此前未被充分利用的链:

  • 1973 年 Hugh Montgomery 关于 zeta 函数零点分布的工作;
  • Baluyot、Goldston、Suriajaya、Turnage-Butterbaugh 等人在不预设黎曼猜想成立的情况下扩展 Montgomery 方法的研究;
  • 2000 年 Enrico Bombieri 发表的另一项相关研究。

Claude 选取了一个合适的有限维函数空间,研究 Weil 厄米型在该空间上的限制,将临界线上零点贡献的非负结构与临界线外成对零点产生的不定结构放入同一框架,并允许对应矩阵出现非对角项,借助一阶矩和二阶矩信息建立关于矩阵秩的不等式,最终得到 67.2%。Anthropic 在其技术说明中专门用「courage」(胆量)来形容这关键一步。

自我查重与形式化验证

得出结果后,Claude 没有急于宣布胜利,而是展开多轮自我怀疑:安排子 Agent 重新检查证明、主动搜索反例、从 arXiv 下载 54 篇相关论文排查是否已被发表,并让其他 Agent 尝试用独立路径重新推导。随后 Claude 主动建议 Anthropic 邀请人类数论专家进行验证。

Anthropic 内部数学家 Levent Alpöge 和 Ralph Furman 检查了 Claude 的工作并整理出更简洁的证明说明;Claude 还与员工 Eric Easley 合作,将核心结果写成 Lean 形式化证明,并通过 comparator 验证工具的检查;该领域的两位专家 Brian Conrey 和 Dan Goldston 也受邀审阅。不过需要明确的是,Lean 验证通过仅意味着被形式化的推理过程符合形式逻辑规则,专家审阅也尚未替代数学共同体的完整检验。

对 AI 科研的启示

Anthropic 官方表示,并不认为当前这套技术能够一路推进到证明黎曼猜想。真正让他们感兴趣的,是整个研究流程本身:面对一个没有已知答案的开放问题,Claude 通过大量失败尝试、多 Agent 协作、前人文献重组和自我验证,最终给出一个意外的数学结果。

一个有趣的细节是,Claude 一开始对能否取得真正进展也颇为怀疑,可能是因为训练数据中包含了太多关于「AI 在科研上有局限」的论述。它最终是在人类反复输入鼓励性话语后才一路推进下去。Anthropic 在文章结尾调侃称,或许 Claude 和很多人一样,都低估了 AI 能力进步的速度。当数十甚至上百个 Agent 可以并行探索不同路线时,过去因时间、精力与阅读规模所限而难以验证的数学想法,将第一次获得被大规模试错的机会。黎曼猜想仍未被攻克,但从今往后,那些曾只能由少数天才独自跋涉的数学无人区,正在出现来自 AI 的同行者。

信源