行业动态
开源模型首次报告 IMO 金牌级水平
Ethan Mollick 指出,开源模型首次在 IMO 竞赛中报告达到金牌水平,此前该门槛仅由闭源模型跨过。
2026.07.22 · 周三约 2 分钟阅读
知名 AI 评论者、沃顿商学院教授 Ethan Mollick 近日在 X 平台发文指出,开源模型首次在国际数学奥林匹克(IMO)竞赛中报告达到金牌水平,这是一个重要的能力里程碑。他同时推测,Kimi K3、GLM-5.2 等模型也有可能达到同等水准。
IMO 金牌门槛的分量
IMO 是公认难度最高的中学数学竞赛之一,长期被视为衡量机器高级数学推理能力的试金石。Mollick 在评论中特别强调,该门槛在去年由当时尚未公开发布的闭源大模型率先跨过,如今开源阵营也达到了这一水平。在他看来,这标志着开源模型在顶级数学推理领域开始具备与闭源前沿模型正面竞争的实力。
候选模型与开放生态影响
Mollick 在原文中并未点名是哪款开源模型率先报告了 IMO 金牌级成绩,仅以「Kimi K3」和「GLM-5.2」为例说明可能达标的范围。这意味着:
- 开源权重模型在长链推理、数学证明类任务上正快速逼近闭源前沿水平。
- 社区与中小机构首次可以在本地部署具备 IMO 金牌水准的推理模型。
- 围绕数学与科学推理的评测体系,将面临更多来自开源阵营的对比压力。
仍需关注的问题
需要注意的是,Mollick 的判断目前来源于社交媒体评论而非论文或官方发布,相关成绩的评测条件、题目来源、评判标准等关键细节尚未公开披露。在模型版本、推理设置与是否使用工具增强等前提被进一步澄清之前,这一里程碑的完整含义仍有待验证。但无论如何,「开源模型达到 IMO 金牌级」这一信号本身,已足以引发开发者社区对开放权重模型推理能力上限的重新评估。
