开源
Qwen3 27B 推理档位实测:xhigh 画质更佳但耗时约为 low 的 7 倍
社区用户在 RTX 5080 笔记本上对比 Qwen3 27B 量化版三种推理档位生成 SVG 的表现,xhigh 视觉…
2026.08.16 · 周日约 3 分钟阅读
Reddit 用户 Danmoreng 在 r/LocalLLaMA 发布了一次针对 Qwen3 27B 社区量化版(unsloth/Qwen3.8-27B-UD-IQ3_XXS)的快速实测,比较 low、medium、x-high 三种推理档位在 SVG 生成任务上的表现差异。
测试场景与硬件配置
测试使用单一 prompt「生成一只鹈鹕骑自行车的精致 SVG」,每个档位取 3 个不同 seed 的平均结果。运行环境如下:
- GPU:NVIDIA RTX 5080 笔记本版,16 GB 显存
- 推理框架:llama.cpp build 10451(commit 10bf611e5)
- 上下文长度:65,536
- KV 缓存:Q8_0
- 启用 Flash Attention 与 MTP 推测解码(--spec-default --spec-type draft-mtp)
- 单并发槽位
三个档位的实测数据
| 档位 | 推理 token | SVG token | 总输出 token | 总耗时 | 生成速度 | MTP 接受率 | 视觉得分 |
|---|---|---|---|---|---|---|---|
| Low | 4,418 | 3,966 | 8,387 | 111.6 s | 75.4 t/s | 62.1% | 21.8 / 25 |
| Medium | 5,918 | 3,038 | 8,959 | 127.4 s | 70.5 t/s | 58.3% | 22.5 / 25 |
| X-High | 39,398 | 5,085 | 44,487 | 717.8 s | 62.0 t/s | 52.7% | 24.0 / 25 |
视觉得分由 Codex 给出。几个值得关注的数字:
- 视觉得分最高档与最低档之间仅相差 2.2 分
- xhigh 推理 token 数约为 low 的 9 倍,总耗时约为 low 的 6.4 倍
- MTP 推测解码接受率随推理深度增加而下降,从 62.1% 降至 52.7%
结论与局限
原帖作者表示,xhigh 档位在视觉保真度上确实有明显优势,但代价是耗时显著拉长;low 与 medium 之间差距较小,速度与质量相对接近。作者自己也强调测试「不太科学」,仅作为社区参考。
对多数本地部署用户而言,medium 档位在速度与输出质量之间提供了较为均衡的折中。需要说明的是,该测试仅覆盖单一 prompt、单一量化版本与单一硬件配置,结论不宜直接外推到其他模型、其他任务或更高显存平台。
