小米 MiMo-V2.6 开源登顶全球:6 天训练烧 347 万美元
小米发布并开源 MiMo-V2.6 系列,Pro 版以 46 分登顶 Artificial Analysis 全球开源榜…
小米于 9 月 22 日正式发布并开源 MiMo-V2.6 系列模型,其中旗舰 Pro 版在 Artificial Analysis 综合智能指数中取得 46 分,超越 GLM-5.3、Qwen3.8 Max 等主流模型,登上全球开源模型榜首。相比之下,上一代 MiMo-V2.5-Pro 在同一指数上仅得 26 分。能力大幅提升的同时,API 价格保持不变。在同等智能水平下,MiMo-V2.6 的任务成本约为海外同类模型的 1/20 至 1/60。
开源旗舰逼近闭源顶级
小米这次的成绩不止于综合指数。具体到任务层面:
- DeepSWE v1.1(多步骤软件工程):MiMo-V2.6-Pro 得 71.9 分,GPT-5.6 Sol 为 73 分,Claude Opus 5 为 74 分,三者已相当接近。
- Toolathlon-Verified(跨工具协作):MiMo 76.9 分,高于 GPT-5.6 Sol 的 74.9 分。
- OSWorld-Verified(图形界面操作电脑):MiMo 82 分,GPT-5.6 Sol 与 Claude Opus 5 分别为 83 分和 83.4 分。
在上一代对比中,MiMo-V2.5-Pro 的 DeepSWE 与 Toolathlon-Verified 成绩分别为 19 分和 49.1 分,一代之间分别提升至 71.9 分与 76.9 分,进步幅度显著。
价格成为新的「斩杀线」
按 Artificial Analysis 的统计口径:
- MiMo-V2.6-Pro 每任务加权平均成本约 0.13 美元;
- Claude Opus 5.5(中等推理档)每任务成本约 1.34 美元,同口径指数得 51 分;
- GPT-5.6 Sol(max)每任务成本约 1.99 美元。
按评测任务构成估算,执行一万次任务的费用:MiMo 约 1300 美元,Claude 约 13400 美元,GPT 约 19900 美元。这一成本差距,使 MiMo 成为行业新的价格参照线。能力更低而成本更高的模型,其市场空间被进一步压缩。
后强化学习方法成为关键
MiMo-V2.6 训练的核心改进集中在强化学习阶段。训练系统让模型在真实任务中尝试多种做法,再依据结果给予奖励:
- 每次更新包含 1568 个任务提示,每条提示生成 16 条执行轨迹,覆盖代码编写、工具调用、视觉信息处理、网络安全等多种任务类型。
- 评判系统对同一任务的多种方案进行横向比较,按质量分配奖励,引导模型选择更高效的执行路径。
- 对抗评估、异常检测与多验证器交叉检查用于防止模型钻评分系统的空子。
训练过程已部分公开展示:不到 6 天内 Flash 与 Pro 各完成 30 步更新,每个版本处理约 75 万条执行轨迹。在未参与训练的 DeepSWE v1.1 评测中,Flash 从 48.8 分提升至 65.68 分,Pro 从 58.4 分提升至 72.57 分。
这轮训练的成本也一并披露:Flash 与 Pro 合计约 347 万美元(约合人民币 2400 万元),平均每日逾 58 万美元,每小时约 3 万美元(约合 20 万元人民币)。小米在开源模型权重的同时,也开放了技术报告、训练环境与强化学习代码。
小米的 AI 战略:从模型到终端
小米于 2023 年 4 月组建大模型核心团队,2025 年 4 月发布首个开源大模型,距此次登顶不到一年半。对于这家以手机、汽车与智能家居著称的公司而言,模型能力只是起点。
- 自研玄戒芯片可针对端侧 AI 的算力、功耗与内存需求做优化。
- MiMo 已具备理解需求、调用工具和执行任务的能力,可与小米手机、汽车、家电的操作系统深度整合。
- 端侧 + 云侧的协同,让「一句话让设备帮忙办事」的体验成为可能。
短期看,模型能力与价格是开发者关注的核心;长期看,小米手中的硬件生态才是 MiMo 区别于其它开源模型的真正变量。当用户因为 MiMo 的能力而选择小米手机、汽车或家电时,大模型业务的战略意义便超越了订阅收入本身。
