桃子桃子快讯
返回首页
开源

Qwen3.8-2.4T 开放权重,国产超大模型架构走向趋同

阿里开源 2.4T 参数的 Qwen3.8,首次开放 Max 规模权重,92 层混合注意力、512 专家,并与 Kimi…

2026.08.13 · 周四5 分钟阅读

8 月 13 日,阿里通义千问正式开放 Qwen3.8-2.4T 的模型权重,总参数达 2.4 万亿,是 Qwen 首次开放 Max 规模的旗舰模型。此前 Qwen 长期保持「开放权重模型 + 闭源 Max 模型」的双线策略,从 Qwen-72B 到 Qwen2.5-72B 均属前者,而 Qwen-Max、Qwen2.5-Max 等仅通过 API 提供。本次开源打破了这一区隔,但也只公布了架构、后训练与推理基础设施信息,并未附带完整模型权重。

架构:混合注意力 + 大规模 MoE

Qwen3.8 共 92 层,每 Token 激活约 95B 参数,采用 512 个专家(每次路由 10 个 + 1 个共享专家)。与 Kimi K3 的 896 专家相比,每个专家更大,总激活量略小(K3 每次激活 103B)。

注意力机制延续 Qwen3.5 的混合架构:92 层由 23 组重复结构组成,每组包含 3 层 Gated DeltaNet 与 1 层 Gated Attention,即 69 层线性注意力 + 23 层全局注意力,比例约为 3:1。这一设计与 Kimi K3 高度相似——K3 的 93 层中含 69 层 KDA 与 24 层 Gated MLA,KDA 可视为对 Gated DeltaNet 遗忘机制的进一步细化。

Qwen3.8 原生上下文 262,144 Token,可扩展至 1,010,000 Token,并经过多步 MTP 训练;层间残差仍沿用 Qwen3.5 的 Pre-Norm 结构,暂未引入 K3 的 AttnRes。

推理基础设施:FP4 单节点可部署

Qwen 并未像 Kimi K3 技术报告那样系统披露训练侧 Infra,但推理侧信息较为完整:

  • 量化:官方提供 BF16 与 FP8 checkpoint,Inferact 进一步提供 NVFP4 与 MXFP4 版本;BF16/FP8 完整版至少需要两台 NVIDIA B300 或 AMD MI355X 节点,FP4 可压缩到单节点。
  • 并行策略:Attention 部分以张量并行(TP)为主,MoE 部分依靠专家并行(EP),并通过融合通信、专用 MoE Kernel 与高速互联网络降低专家调度开销。
  • MTP:示例配置一次预测 3 个候选 Token,若被主模型接受,可一次推进多个 Token,减少自回归生成的串行延迟。

后训练:重心明显转向 Agent

Qwen 官方将 Agent Execution 列为核心升级方向,强调自主规划、环境反馈处理与端到端任务完成能力。从官方对照看,增量主要出现在 Agent 类基准上:

  • Terminal Bench 2.1:74.5 → 86.6
  • PaperBench:64.8 → 93.0
  • JobBench:31.3 → 53.4
  • Toolathlon Verified:49.7 → 72.5

相比之下,传统知识与推理基准变化很小:GPQA Diamond 仅由 92.4 升至 92.6,HLE 由 41.4 升至 43.6。Qwen3.8 默认开启 preserve_thinking,可在多轮交互与工具调用中保留此前推理状态,这一做法与 Kimi K3 几乎一致,说明「保留推理状态」正从工程框架职责转入旗舰 Agent 模型本身的训练与接口范式。

开源规则与行业收敛

本次开源的 Qwen3.8-2.4T-A95B 并不等同于云端 Qwen3.8-Max:开放版本为纯文本、仅支持 thinking 模式、原生 262K 上下文,而官方 Max 在此基础上额外提供视觉输入、non-thinking 模式、默认 1M 上下文与内置工具。许可证从 Apache 2.0 改为 Qwen3.8-Max License,允许广泛使用与商业分发,但对月活超 1 亿或月收入超 2000 万美元的商业产品设有界面署名要求,对集团年营收超 5000 万美元的 MaaS / AI Work Assistant 业务则需另行取得许可。这一阈值设定与 Kimi K3 License 思路相近。

把 Qwen3.8 与 Kimi K3 并置观察,2026 年旗舰模型已呈现明显技术收敛:

  • 总参数进入 2–3T,激活参数控制在 100B 左右;
  • 注意力采用约 3:1 的递归/线性层与全局 Attention 混合;
  • 上下文目标稳定在百万 Token 级别;
  • 后训练重点转向 Coding、Research 与长程 Agent;
  • 部署越来越依赖 FP4/FP8、融合 kernel、专家并行与机架级高速互联。

差异更多体现在细节:K3 走得更激进,同时引入 KDA、AttnRes 与 Stable LatentMoE;Qwen3.8 则把已在 Qwen3.5 验证的混合注意力架构直接 Scale 到 Max 级别,并围绕长程 Agent 与生产推理补齐生态。配方底子趋同之后,下一步谁能打破这一底子做出新意,将更值得期待。

信源