工具
LocalLLaMA 用户实测:Muse Glimmer 30B 与 Qwen 27B、Gemma 31B 推理对比
Reddit 用户 WonderRico 发布本地大模型基准测试,Muse Glimmer 30B 综合得分尚可但请求量…
2026.08.12 · 周三约 2 分钟阅读
Reddit r/LocalLLaMA 板块用户 WonderRico 发布了一轮本地大模型基准测试结果,对象包括 Muse Glimmer 30B、Qwen 3.6 27B、Gemma4 31B 等多款模型及其若干微调版本。据其简述,Muse Glimmer 30B 在达到最终得分时所需的请求数明显高于 Qwen 系列(约接近两倍),也几乎是 Gemma 系列的三倍;不过其综合得分尚可,作者也强调该模型「并非编程专用模型」。
评测概览
- 对比对象:Muse Glimmer 30B、Qwen 27B 系列、Gemma 31B 系列,以及其他本地可跑模型与微调版本。
- 结论摘要:Muse Glimmer 30B 综合表现可接受,但推理吞吐效率偏低;Qwen 与 Gemma 系列在请求数效率上明显占优。
- 后续计划:作者预告将放出 Qwen 3.8 的测试结果。
数据来源
完整榜单与明细已整理在作者维护的 GitHub Pages 站点上,提供主榜单(benchmark-main)与逐项细节(benchmark-detail)两个页面,便于读者复核各模型的耗时、请求数与得分。本次贴文本身仅为简要说明,详细信息需跳转外部页面查看。
参考与局限
- 来源为个人社区评测,非厂商或权威机构发布,可信度有限。
- 评测侧重本地推理场景,与在线 API 服务或云端大规模评测口径不同,结果不宜直接外推。
- 涉及的具体模型版本号与命名较为非标,读者引用时建议核对原始页面。
