桃子桃子快讯
返回首页
开源

Motif-3-Beta 上线 Hugging Face:314B 总参数稀疏 MoE

Motif-3-Beta 模型权重登陆 Hugging Face,总参数约 314B,每 token 激活约 13B,原…

2026.07.21 · 周二2 分钟阅读

Motif-3-Beta 近日被上传至 Hugging Face,公布了一套大体量的稀疏 Mixture-of-Experts(MoE)模型权重,总参数约 314B,每个 token 仅激活约 13B 参数。该模型定位为通用多语言模型,原生支持 256K 上下文长度,参数规模与长上下文能力均处于当前开源权重模型的第一梯队。

核心架构

根据公开信息,Motif-3-Beta 采用稀疏路由设计:

  • 专家规模:共 384 个专家,每个 token 路由激活其中 8 个;
  • 共享专家:额外设置 1 个共享专家,用于承载跨任务通用表征;
  • 激活比例:按总参 314B、激活 13B 估算,激活比例约为 4.1%,属于典型的稀疏 MoE 配置。

这一架构与近期主流大模型路线一致,通过大幅扩大总参数、压低单次推理激活量,在容量与推理成本之间取得平衡。

上下文与适用场景

模型原生支持 262,144 token 上下文窗口,对长文档摘要、代码库理解、多轮对话历史等任务具备较好的承载能力。官方描述将其定位为多语言通用模型,意味着发布方可能针对多语种语料做了相应训练配比,但具体语种覆盖与训练数据规模尚未披露。

信息可信度说明

目前消息源为社交平台单条发布帖,权重虽已托管于 Hugging Face,但发布方、机构背景、训练细节、benchmark 表现均未在公开渠道给出进一步说明。在缺少官方博客或模型卡详细披露的情况下,性能与可靠性需以社区复测为准。

小结

Motif-3-Beta 以 314B 总参数、13B 激活的稀疏 MoE 设计叠加 256K 长上下文,在参数规模上具备一定竞争力,但因信息源单一、背景资料有限,其实际能力与生态影响仍有待更多一手资料与第三方评测加以验证。

信源