桃子桃子快讯
返回首页
模型发布

Qwen 3.8 或改为 27B 稠密架构,社区讨论本地部署影响

社区传言 Qwen 3.8 可能弃用 MoE 改为 27B 稠密模型,担忧消费级显卡部署门槛上升。

2026.08.14 · 周五2 分钟阅读

近日 r/LocalLLaMA 社区出现关于 Qwen 3.8 版本的讨论帖,引发开源模型爱好者的关注。据发帖者推测,Qwen 3.8 可能会以 27B 稠密(dense)模型的形式发布,而不再延续此前的 MoE(混合专家)架构。该推测尚未获得官方确认,社区仍在等待正式消息。

从 MoE 到稠密:架构变化引发讨论

Qwen 系列此前在 Qwen 3.6 阶段推出了 35B-A3B 模型,采用 MoE 设计,激活参数约 3B。由于激活参数量较小,社区用户可以通过 offloading 方式在消费级显卡上运行。发帖者表示,此前在 RTX 3060(12GB 显存)上运行该模型时,推理速度可达到约 70 tok/s。

若 Qwen 3.8 改为稠密架构,整体参数量与计算量将不再受 MoE 稀疏激活的「红利」加持,本地部署对显存和算力的要求会显著上升。

消费级硬件的部署门槛

稠密模型无法享受 MoE offloading 的优势,所有参数在推理时均需参与计算。发帖者估算,在 RTX 3060 上运行 27B 稠密模型,速度可能比 MoE 版本慢「100 倍甚至更多」,对仅有入门级显卡的用户来说基本意味着「跑不动」。

  • 此前 35B-A3B(MoE):约 70 tok/s@RTX 3060
  • 若改为 27B 稠密:推理速度可能急剧下降

信息的局限与待确认事项

需要指出的是,截至本文整理时,Qwen 3.8 的发布并未由通义千问官方正式宣布。帖中关于「今天可能发布」「27B 稠密」的表述均为社区用户推测而非官方信息披露,具体的参数量、架构、上下文长度、量化方案与发布日期均未确定。读者应以通义千问官方渠道后续公告为准。

小结

如果 Qwen 团队确实在下一版本中回归稠密架构,意味着开源大模型在「轻量化本地推理」与「更强整体能力」之间的取舍将出现新的权衡。对依赖消费级显卡的本地 AI 爱好者而言,硬件门槛的变化是值得持续关注的动向。

信源