桃子桃子快讯
返回首页
研究论文

IMO 2026 大模型评测:前沿模型接近满分,子级模型均未攻克压轴题

研究团队在 IMO 2026 新题上对比多款大模型,前沿模型拿到接近满分,Claude 与 GLM 等子级模型依赖不同…

2026.07.26 · 周日3 分钟阅读

一支自称为前 IMO 奖牌获得者的团队近日在 Reddit r/MachineLearning 公布了他们对多款大模型在 IMO 2026 赛题上的对比评测结果。评测覆盖前沿模型(代号 sol 与 fable)、Claude Sonnet/Opus 系列,以及开源权重模型 GLM,并搭配不同时下主流的工程框架(harness)进行测试。团队同时开源了配套的多智能体框架 AutoFyn。

评测设计:为什么选 IMO

IMO 题目被研究者视为检验大模型推理能力的高质量基准,原因有三:

  • 题目为全新内容,几乎不可能出现在任何模型的训练数据中;
  • 高难度数学题可以较好地代理「通用智能」能力;
  • 多步骤复杂任务天然适合评估编排与工程框架的作用。

主要结果

  • 前沿模型(sol、fable)在任意工程框架下均能取得接近满分甚至满分的成绩;
  • Claude Sonnet 与 Opus 在 Web 默认接口下表现较差,使用 Claude Code 这类供应商级 harness 后显著提升,进一步换用 AutoFyn 多智能体 harness 后仍有可观改进,但即便如此仍未能追上前沿模型水平;
  • 开源权重模型 GLM 在无 harness 条件下与 Claude Sonnet 相当,在 AutoFyn 下提升幅度类似;
  • 具体数值评分须参考团队随附论文。

最难题 P3:所有「子前沿」模型全军覆没

评测中难度最高的 P3 题存在一个关键化简步骤,所有子前沿模型在所有 harness 下均未能完成该步骤。团队特别指出:即使在一次长达 20 小时的运行中,模型几乎独立证明了其他所有结论,却卡在完全相同的步骤上。工程框架只能提供检索与验证,无法替代真正解决题目所需的「关键想法」。这也印证了 harness 工程的边界——它能放大能力,但不能凭空创造能力。

幻觉与评分机制

评分由另一款前沿模型完成,并由团队进行人工复核,确保结果可信。评测中仍观察到幻觉问题,例如 Claude Sonnet 曾对 P3 给出错误的「伪解」并自信陈述。这说明即使在数学这种可验证领域,大模型的「虚假自信」仍未消除。

开源与可复现

团队在 GitHub 公开了完整论文与审计轨迹(Audit Trails),覆盖每一道题目的模型原始输出与运行记录,便于社区复现与进一步分析。AutoFyn 本身作为可定制的多智能体框架也已开源。

局限与思考

本次评测中「sol」与「fable」的具体身份未在帖子中明确披露,读者需自行查阅论文确认。若它们确实属于顶级前沿模型,则结论具有较强参考价值;若为非主流模型,则「前沿」一词的对照意义会被削弱。此外,评测仅基于 IMO 六道题,样本量有限,结论不应过度泛化。但对于关注大模型数学推理与 harness 工程效果的开发者与研究者而言,这仍是一份值得参照的实验记录。

信源