开源
社区发布 Qwen3 27B 精简模型 称可减少九成 token
用户在 HuggingFace 上发现 grug-27b 模型,声称在基准测试中优于原版 Qwen3 27B 并可减少…
2026.07.23 · 周四约 2 分钟阅读
一名 Reddit 用户在 r/LocalLLaMA 板块分享了一款名为 grug-27b 的开源模型,称其在基准测试中优于原版 Qwen3 27B,并可将推理所需的 token 数量削减超过 90%。该模型托管在 HuggingFace 上,作者为 ProCreations,但目前所有性能数据均来自模型作者的自述,尚未经过独立验证。
模型来源与发布渠道
原帖发布者表示,自己是在浏览 HuggingFace 时偶然发现了这个模型仓库(ProCreations/grug-27b),并注意到仓库中附带的相关声明。帖子由用户 AppealSame4367 发布于 r/LocalLLaMA 板块,属于社区自发分享,而非官方渠道公告。
核心声明
- 模型作者声称 grug-27b 在基准测试中表现优于原版 Qwen3 27B
- 据称可将推理所需 token 数量减少 90% 以上
- 发布者推测,若上述声明属实,原本在老旧笔记本上以约 3 tps 速度运行的 27B 模型,其思考(thinking)阶段的体验可能接近 30 tps
验证情况
原帖发布者明确表示「尚未对该模型进行实际测试」,因此相关性能数字完全依赖模型作者的自我披露,缺乏独立基准复现或第三方评测数据支撑。在缺乏实测验证的情况下,该模型的真实表现仍存在不确定性,感兴趣的读者需自行下载测试后方可判断其实际效果。
小结
grug-27b 是开源社区中针对 Qwen3 27B 进行精简/优化的一次尝试,其「90% token 削减」的声明若属实,将对低端硬件本地推理用户具有积极意义。不过,由于信息源单一、未经第三方验证,建议将其视为社区实验性项目而非成熟可用方案。
