工具
Qwen3.8 27B 与 35B-A3B MoE 12GB VRAM 本地对比
Reddit 用户在 RTX 5070 Ti 笔记本上对比 Qwen3.8 27B 量化版与 Qwen3.6 35B-A…
2026.08.17 · 周一约 2 分钟阅读
一名 Reddit 用户在 12GB VRAM 笔记本 GPU(RTX 5070 Ti Laptop)上对三款本地模型做了小规模对比:Qwen3.8 27B 密集模型的 Q2_K_XL 与 Q3_K_XL 两个量化版本,以及 Qwen3.6 35B-A3B MoE 的 Q4_K_M 版本,重点考察生成速度与基础质量。
测试环境
推理框架使用 llama.cpp 的 CUDA 后端,统一开启 4k 上下文、q8_0 KV 缓存、--fit on,未启用 MTP,所有测试为单轮、温度 0 的确定生成。
基础推理测试
测试包含 6 道简单推理题,例如衬衫原价计算、单词 strawberry 中 r 的数量、1 kg 钢铁与 1 kg 羽毛谁更重、球拍球问题、bloops-razzies-lazzies 逻辑判断以及 17×24。
- Qwen3.8 27B Q2:生成 35.9 t/s,答对 5/6,球拍球题答成 0.10(正确 0.05)。
- Qwen3.8 27B Q3:生成 7.5 t/s,6/6 全部正确。
- Qwen3.6 35B-A3B Q4 MoE:生成 59.0 t/s,6/6 全部正确。
短问答与编程测试
在「为 12GB VRAM 笔记本选择密集 27B 还是 35B-A3B MoE」的短问答中,MoE 生成速度 52.6 t/s,明显快于 Q3 密集版的 8.1 t/s。编程题要求用 JavaScript 实现井字棋胜者判断函数,三个模型均输出正确代码,MoE 生成 51.9 t/s,Q3 密集版仅 9.1 t/s。
作者结论
作者总结:Q2 量化版速度可观但已在常识题中出现质量下滑;Q3 量化版保住了正确率,但在此硬件上交互体验已很慢。综合速度与质量,Qwen3.6 35B-A3B MoE 仍是更优选择。作者也明确说明这并非正式评测,仅是一次本地小型 sanity 与速度对比,并邀请社区提供更贴近实际工作流的 coding 或 agent 提示词以复测。
