开源
IFM 开源模型及训练代码,提出 MoVA 与 Uno 新架构
IFM 同步发布模型权重、训练代码、数据配方与评估结果,配套推出注意力内专家路由 MoVA 与并行 token 块扩散适…
2026.09.03 · 周四约 2 分钟阅读
AI 研究方向再次向「完全可复现」靠拢。IFM 在发布模型权重的同时,一并开源了训练代码、数据配方、中间检查点、训练日志与评估结果——这一组合在开源生态中并不常见,意味着任何研究者都能从零复现整个流程,而不只拿到最终权重。
同步发布的两项新架构
本次发布中,两项架构设计被强调为模型的核心组件:
- MoVA:将「专家路由」机制放进注意力机制内部,让模型在注意力计算阶段就完成对不同专家路径的选择,而不是像传统 MoE 那样在 FFN 层之后才做路由。
- Uno:一种扩散适配器,能够以并行的方式生成 token 块,把扩散模型从「生图」领域的能力迁移到离散 token 的批量生成中。
两者打包发布,意味着 IFM 试图把「注意力内的稀疏化」与「token 级的并行扩散生成」整合到同一套模型栈里。
信息有限:尚缺关键数据
需要指出的是,目前公开信息仍以发布声明为主,以下细节尚未披露:
- 模型参数量与具体规模;
- 在主流 benchmark(如 MMLU、HumanEval、GSM8K 等)上的具体得分;
- IFM 的背景(是否隶属高校实验室或独立研究小组);
- 训练数据规模与算力消耗。
在缺少这些数据的前提下,MoVA 与 Uno 的实际效果、与既有方案的对比,仍有待进一步公开报告或第三方复现来验证。
可关注的方向
如果后续公布完整技术报告与基准结果,这套「全流程开源 + 注意力内 MoE + token 块扩散」的组合,对开源社区尤其是希望在推理效率和生成范式上做实验的研究者,可能提供一个新的起点。短期内,研究者最需要的是:参数量、训练成本、与同等规模稠密或传统 MoE 模型的对比曲线。
