桃子桃子快讯
返回首页
模型发布

韩国 Motif-3 模型发布,综合基准略胜 Qwen 3.7 Max

韩国 Motif-Technologies 推出 314B 总参数 / 13B 激活的 MoE 模型 Motif-3,多…

2026.08.10 · 周一4 分钟阅读

韩国 AI 基础模型项目(독파모)新一轮的竞争结果浮出水面。Motif Technologies 正式发布旗舰模型 Motif-3,在多类基准测试中跑出 AAII 综合得分约 47.364,略高于 Qwen 3.7 Max,被 Reddit r/LocalLLaMA 用户视为该轮评估的领先候选。以上数据来自社区整理,官方一手说明暂未公布。

项目背景:韩国国家队模型之争

韩国 AI 基础模型项目第二阶段的核心竞争者包括四家厂商:Upstage(Solar 系列)、LG AI Research(EXAONE 系列)、SKT(A.X 系列)以及 Motif Technologies。由于 LG EXAONE 在多项基准上表现未达预期,业界普遍判断 Upstage、Motif、SKT 更有机会晋级。Reddit 用户据此推断,Motif-3 在本轮中跑在了前面。

Upstage 的 Solar Pro 4 预期落地分在 40 出头(据传规模 250B 总参数 / 15B 激活),单看基准表现,Motif 与 Solar Pro 4、SKT 的正面较量将是下一阶段的看点。

模型规格:低激活的 MoE 设计

Motif-3 采用稀疏激活(MoE)架构,关键参数如下:

  • 总参数:314B
  • 激活参数:13B
  • AAII 综合得分:47.364

在激活参数仅 13B 的前提下取得这一成绩,体现了 Motif 在 MoE 路由与训练策略上的一定优势。同台对比的 MiniMax-3(428B-A23B)、GLM-5.1(744B-A40B)、Kimi-K2.6(1T-A32B)激活参数均高出 Motif-3 数倍。

主要基准表现

Motif-3 在四大类基准上的成绩如下:

  • Agentic(智能体能力):GDPVal v2 为 38.7,τ²-Bench Telecom 为 94.7(同台前列),τ³-Banking 为 35.3,ITBench 为 51.5。
  • Coding(编程能力):SWE-Bench Verified 为 76.2,Terminal-Bench 2.1 为 74.9(同台领先),SciCode 为 40.6。
  • Reasoning & Knowledge(推理与知识):IMOAnswerBench 为 83.2,GPQA Diamond 为 83.4,HLE 为 37.0,CritPt 为 6.6。
  • 长上下文与指令遵循:AA-LCR 为 72.3,IFBench 为 78.2。

部分推理类测试如 CritPt(6.6)和 τ³-Banking(35.3)相对偏弱,是 Motif-3 后续迭代需要补强的方向。

横向对比:小激活、强综合

Motif-3 与 Qwen-3.7 Max、DS-v4-Pro(1.6T-A49B)、Kimi-K2.6、GLM-5.1 的主要差异点:

  • 智能体:ITBench 51.5 为同台最高,τ²-Bench Telecom 与 Kimi-K2.6 持平。
  • 编程:SWE-Bench Verified 76.2 落后 Qwen-3.7 Max 的 80.4。
  • 推理:GPQA Diamond 83.4 不及 Qwen-3.7 Max 的 92.4;IMOAnswerBench 83.2 落后 7 分。
  • 长上下文:AA-LCR 72.3 高于 Qwen-3.7 Max(75.0 下方)与 GLM-5.1(68.0)。

综合来看,Motif-3 以显著更低的激活参数换来了与中大型模型相当的综合表现,在智能体与编程类基准上甚至部分占优;但在高级推理、长上下文稳健性等维度,与 Qwen-3.7 Max、DS-v4-Pro 仍有差距,能否在韩国 AI 基础模型项目下一轮赢得更大份额,仍取决于后续能力补齐与官方披露的实际表现。

信源