开源
社区用户推出 Qwen3.8-27B MTP 移植版,声称可节省显存
Hugging Face 用户 jojohai 发布将 MTP(多 token 预测)模块移植到低量化 Qwen3 的模…
2026.08.23 · 周日约 1 分钟阅读
近日,Hugging Face 用户 jojohai 发布了一个名为 Qwen3.8-27B-MTP-graft 的模型仓库,将 MTP(Multi-Token Prediction,多 token 预测)模块移植到低量化版本的 Qwen3 模型上。MTP 是当前主流大模型用于加速推理和提升生成效率的常见技术之一,原本属于较高规格官方权重的一部分,但在最低量化档位中通常不会附带。
移植动机与测试环境
作者表示,官方 Unsloth 量化版本在最低档位下并未附带 MTP 文件,因此他尝试将 MTP 模块「嫁接」回低量化权重中。测试环境为 Vulkan 后端,作者称该方案相比外挂外部 MTP 文件可以节省显存(RAM)。
质量提醒
作者明确强调,不保证模型回答的质量,并指出:
- 在关闭「思考模式」(Thinking Off)时,模型表现明显偏弱;
- 当询问有关布列塔尼(Brittany)文化的问题时,开启思考模式后模型能「恢复一些智能」。
换言之,作者并未提供系统性 benchmark,仅以个别场景作为示意。
小结
这是一次社区层面的个人实验性工作,对关心 Qwen3 低显存部署、MTP 机制或推理加速的开发者有一定参考价值,但缺乏完整评测与质量背书,不宜作为生产环境选型依据。感兴趣的用户可直接前往 Hugging Face 模型页自行评估。
