小红书大模型 IMO 满分夺金,中国首个官方认证
小红书大模型 dots-note-3.0 以 42 分满分获 IMO 2026 金牌,为中国大模型首次获此认证,也是继…
小红书旗下大模型 dots-note-3.0 在 IMO 2026 国际数学奥林匹克竞赛中以 42 分满分斩获金牌,成为中国大模型首个获得 IMO 官方金牌水平认证的项目,也是继谷歌 Gemini 之后全球第二个达到该成绩的大模型,且比 Gemini 2025 年的 5/6 正确率更进一步,做到了零失误。
比赛成绩与含金量
IMO 2026 题目共 6 道,覆盖代数、组合、几何与数论,每题 7 分,总分 42 分。本届金牌线为 29 分,较去年的 35 分下降了 6 分,意味着今年赛题整体难度上升,满分的稀缺性更加突出。dots-note-3.0 在六道题中全部给出完整且经官方评审认可的证明过程,将卷面的理论上限变为实际结果。
端到端自然语言推理
dots-note-3.0 全程使用自然语言端到端处理题目,读题、解析与证明无需借助 Lean 等形式化语言翻译。这与谷歌 Gemini 2024 年首次参赛时仍依赖形式化系统、且部分题耗时数天的方案形成对比。模型还采用智能体方式,结合 Python 代码执行进行推演,并在过程中使用递归自我批判机制审视自身论证。
第三题的非常规解法
第三题为组合博弈问题,业内常见解法是将其转化为图论中的连通性问题后再建立证明。dots-note-3.0 没有沿用此路线,而是直接采用归纳法,设计了恰当的归纳对象与归纳命题,精准抓住了问题最本质的结构。双 CMO 金牌得主刘涵祚、汪千桐均评价该解法「简洁优雅」,认为其结构紧凑、逻辑自然。
为何选择 IMO 作为试金石
IMO 的赛题由专家命制、赛前严格保密,模型无法预先训练,且评审由第三方按正式标准进行,是目前最难靠背题或包装绕过的能力测评。数学与代码是检验大模型底层推理能力最直接的两条赛道,结果难以用语言修饰掩盖,这正是小红书将 IMO 作为技术亮相舞台的原因。
小红书的新定位
长期以来,外界对小红书的技术印象主要集中在内容社区与推荐系统,其基础模型能力缺少公开权威的评估。本次 IMO 满分成绩补齐了这份成绩单,让行业第一次直观看到其在基础模型领域的真实成色。dots-note-3.0 模型即将开源,届时外界可进一步验证其能力边界。
