桃子桃子快讯
返回首页
开源

社区用户发布 Qwen3.8-27B 深度剪枝版,约 22.7B 参数

Reddit 用户对 Qwen3.8-27B 进行层剪枝,得到约 22.7B 参数的精简版本,未做微调,开源 bf16/…

2026.08.20 · 周四2 分钟阅读

近日,Reddit 用户 peplo1214 在 r/LocalLLaMA 社区分享了一项个人实验:基于阿里通义最新发布的 Qwen3.8-27B 模型进行"深度剪枝"(depth pruning),在不进行任何微调的前提下,通过策略性地移除部分 Transformer 层,将模型参数从 27B 压缩至约 22.7B,命名为 Qwen3.8-23B-Mini-Me。

剪枝方法与定位

与常见的量化或蒸馏不同,本次剪枝采用的是"层移除"思路。作者表示,仅删减了模型中的若干层结构,并未对剩余权重做任何后续训练或指令微调。从作者自述的使用体验看,剪枝后的模型在代码生成、智能体(agentic)调用和多轮对话场景下表现尚可,但在部分任务上相比原版 27B 略有退化。作者明确强调"没有跑 benchmark",因此并未宣称该模型在能力上优于现有其他模型。

发布规格与使用提示

  • 提供 bf16、q8、q4 三种量化版本,便于在不同显存环境下部署;
  • 目前仅发布 MLX 格式(适配 Apple Silicon),后续可能补充更多格式;
  • 作者建议沿用 Qwen3.8-27B 原始的对话参数设置,未观察到循环或异常输出。

社区反馈与局限

该工作属于个人探索性质,缺乏系统的基准测试与横向对比数据,剪枝层数、对各类任务的影响等关键技术细节未公开披露。对于关注 Qwen 系列模型本地化部署的开发者而言,Qwen3.8-23B-Mini-Me 提供了多一种显存友好的选择,但实际可用性仍需自行测试验证。作者也在帖中邀请使用者反馈使用体验,以便后续迭代。

信源