桃子桃子快讯
返回首页
工具

AI 累计解决 200 道数学难题,VibeMathed 项目公开追踪记录

VibeMathed 收录 200 道由 AI 首次攻破的数学难题,累计开放年数达 4699 年,其中 101 道通过…

2026.07.30 · 周四4 分钟阅读

由社区维护的数学难题追踪项目 VibeMathed 引发关注。该项目专门收录此前无人解决、由 AI 协助或主导攻破的数学问题,涵盖经典猜想、Erdős 编号问题等多个方向;每条记录都附有可核查的来源、验证标签,并开放投票、评论与新条目提交。

项目规模与覆盖范围

截至目前,VibeMathed 已收录 200 道被 AI 解决的数学问题,这些问题在被攻克前累计开放了 4699 年。其中 101 道已通过 Lean 形式化证明检查器完成机器验证,其余条目按状态分为「Expert-verified」与「Preprint (unrefereed)」等不同等级。社区成员通过评论、投票与提交参与维护,所有问题均可追溯到原始出处或预印本。

已攻破的代表性难题

项目展示了多道长期悬而未决的数学问题,涵盖交换代数、组合学、量子信息、偏序集理论等多个方向:

  • Huneke–Wiegand 猜想(1994 年由 Craig Huneke 与 Roger Wiegand 提出,开放 32 年):涉及一维 Gorenstein 局部环上的张量积结构,由 GPT-5.6-Pro 解决;
  • Erdős #106(离散几何与填充):关于单位正方形内可填充互不相交正方形的总边长上界,被精确有理构造反驳;
  • Mark M. Wilde 猜想(量子条件熵均匀连续性界):被 ChatGPT-5.6 Sol 证明;
  • Stanley 差分偏序集猜想(1988 年提出,开放 38 年):由 TARS 智能体系统部分攻克;
  • 加性组合中的最优指数问题:证明 C(A) 的上确界恰好为 2;
  • Kemeny 最优聚合排名 NP 困难性问题(Dwork、Kumar、Naor、Sivakumar 2001 年提出,开放 25 年):由 GPT-5.6 Sol Ultra 与 Claude Fable 5 联合攻破。

参与的 AI 模型

完成这些证明的模型涵盖多家厂商:

  • OpenAI:Codex、GPT-5.6-Pro、GPT-5.6 Sol / Sol Ultra、ChatGPT-5.6 Sol、ChatGPT / Codex 5.4-5.6 Pro;
  • Anthropic:Claude Fable 5;
  • Google DeepMind:Gemini 3.1 Pro;
  • 腾讯:Hy3(Hunyuan 系列);
  • 其他:名为 TARS 的智能体系统被用于多道差分偏序集相关问题的求解。

部分高难度问题由多个模型协作完成,体现多模型联合推理的潜力。

验证机制与意义

VibeMathed 对每条记录明确标注验证等级,包括 Lean 机器验证、专家验证与未经同行评审的预印本三种状态。这一机制旨在区分「AI 给出形式化证明」与「AI 给出论证但未经形式化检验」两类成果,强调可重复核查性,避免将语言模型的「看似合理」输出与真正可机器验证的定理混为一谈。

项目以社区协作形式持续更新,鼓励新提交、评论与投票,力图系统记录 AI 在数学前沿的实质性进展,而不仅是单一基准测试成绩。对于关注 AI 推理能力、自动化定理证明与机器学习辅助科研的开发者与研究者而言,VibeMathed 提供了一个持续累积的实证数据集,可用于追踪 AI 在不同数学分支中的实际能力边界。

信源