AI 累计解决 200 道数学难题,VibeMathed 项目公开追踪记录
VibeMathed 收录 200 道由 AI 首次攻破的数学难题,累计开放年数达 4699 年,其中 101 道通过…
由社区维护的数学难题追踪项目 VibeMathed 引发关注。该项目专门收录此前无人解决、由 AI 协助或主导攻破的数学问题,涵盖经典猜想、Erdős 编号问题等多个方向;每条记录都附有可核查的来源、验证标签,并开放投票、评论与新条目提交。
项目规模与覆盖范围
截至目前,VibeMathed 已收录 200 道被 AI 解决的数学问题,这些问题在被攻克前累计开放了 4699 年。其中 101 道已通过 Lean 形式化证明检查器完成机器验证,其余条目按状态分为「Expert-verified」与「Preprint (unrefereed)」等不同等级。社区成员通过评论、投票与提交参与维护,所有问题均可追溯到原始出处或预印本。
已攻破的代表性难题
项目展示了多道长期悬而未决的数学问题,涵盖交换代数、组合学、量子信息、偏序集理论等多个方向:
- Huneke–Wiegand 猜想(1994 年由 Craig Huneke 与 Roger Wiegand 提出,开放 32 年):涉及一维 Gorenstein 局部环上的张量积结构,由 GPT-5.6-Pro 解决;
- Erdős #106(离散几何与填充):关于单位正方形内可填充互不相交正方形的总边长上界,被精确有理构造反驳;
- Mark M. Wilde 猜想(量子条件熵均匀连续性界):被 ChatGPT-5.6 Sol 证明;
- Stanley 差分偏序集猜想(1988 年提出,开放 38 年):由 TARS 智能体系统部分攻克;
- 加性组合中的最优指数问题:证明 C(A) 的上确界恰好为 2;
- Kemeny 最优聚合排名 NP 困难性问题(Dwork、Kumar、Naor、Sivakumar 2001 年提出,开放 25 年):由 GPT-5.6 Sol Ultra 与 Claude Fable 5 联合攻破。
参与的 AI 模型
完成这些证明的模型涵盖多家厂商:
- OpenAI:Codex、GPT-5.6-Pro、GPT-5.6 Sol / Sol Ultra、ChatGPT-5.6 Sol、ChatGPT / Codex 5.4-5.6 Pro;
- Anthropic:Claude Fable 5;
- Google DeepMind:Gemini 3.1 Pro;
- 腾讯:Hy3(Hunyuan 系列);
- 其他:名为 TARS 的智能体系统被用于多道差分偏序集相关问题的求解。
部分高难度问题由多个模型协作完成,体现多模型联合推理的潜力。
验证机制与意义
VibeMathed 对每条记录明确标注验证等级,包括 Lean 机器验证、专家验证与未经同行评审的预印本三种状态。这一机制旨在区分「AI 给出形式化证明」与「AI 给出论证但未经形式化检验」两类成果,强调可重复核查性,避免将语言模型的「看似合理」输出与真正可机器验证的定理混为一谈。
项目以社区协作形式持续更新,鼓励新提交、评论与投票,力图系统记录 AI 在数学前沿的实质性进展,而不仅是单一基准测试成绩。对于关注 AI 推理能力、自动化定理证明与机器学习辅助科研的开发者与研究者而言,VibeMathed 提供了一个持续累积的实证数据集,可用于追踪 AI 在不同数学分支中的实际能力边界。
