开源
Motif-3-Beta 上线 Hugging Face:314B 总参数稀疏 MoE
Motif-3-Beta 模型权重登陆 Hugging Face,总参数约 314B,每 token 激活约 13B,原…
2026.07.21 · 周二约 2 分钟阅读
Motif-3-Beta 近日被上传至 Hugging Face,公布了一套大体量的稀疏 Mixture-of-Experts(MoE)模型权重,总参数约 314B,每个 token 仅激活约 13B 参数。该模型定位为通用多语言模型,原生支持 256K 上下文长度,参数规模与长上下文能力均处于当前开源权重模型的第一梯队。
核心架构
根据公开信息,Motif-3-Beta 采用稀疏路由设计:
- 专家规模:共 384 个专家,每个 token 路由激活其中 8 个;
- 共享专家:额外设置 1 个共享专家,用于承载跨任务通用表征;
- 激活比例:按总参 314B、激活 13B 估算,激活比例约为 4.1%,属于典型的稀疏 MoE 配置。
这一架构与近期主流大模型路线一致,通过大幅扩大总参数、压低单次推理激活量,在容量与推理成本之间取得平衡。
上下文与适用场景
模型原生支持 262,144 token 上下文窗口,对长文档摘要、代码库理解、多轮对话历史等任务具备较好的承载能力。官方描述将其定位为多语言通用模型,意味着发布方可能针对多语种语料做了相应训练配比,但具体语种覆盖与训练数据规模尚未披露。
信息可信度说明
目前消息源为社交平台单条发布帖,权重虽已托管于 Hugging Face,但发布方、机构背景、训练细节、benchmark 表现均未在公开渠道给出进一步说明。在缺少官方博客或模型卡详细披露的情况下,性能与可靠性需以社区复测为准。
小结
Motif-3-Beta 以 314B 总参数、13B 激活的稀疏 MoE 设计叠加 256K 长上下文,在参数规模上具备一定竞争力,但因信息源单一、背景资料有限,其实际能力与生态影响仍有待更多一手资料与第三方评测加以验证。
