桃子桃子快讯
返回首页
开源

Qwen3 27B 推理档位实测:xhigh 画质更佳但耗时约为 low 的 7 倍

社区用户在 RTX 5080 笔记本上对比 Qwen3 27B 量化版三种推理档位生成 SVG 的表现,xhigh 视觉…

2026.08.16 · 周日3 分钟阅读

Reddit 用户 Danmoreng 在 r/LocalLLaMA 发布了一次针对 Qwen3 27B 社区量化版(unsloth/Qwen3.8-27B-UD-IQ3_XXS)的快速实测,比较 low、medium、x-high 三种推理档位在 SVG 生成任务上的表现差异。

测试场景与硬件配置

测试使用单一 prompt「生成一只鹈鹕骑自行车的精致 SVG」,每个档位取 3 个不同 seed 的平均结果。运行环境如下:

  • GPU:NVIDIA RTX 5080 笔记本版,16 GB 显存
  • 推理框架:llama.cpp build 10451(commit 10bf611e5)
  • 上下文长度:65,536
  • KV 缓存:Q8_0
  • 启用 Flash Attention 与 MTP 推测解码(--spec-default --spec-type draft-mtp)
  • 单并发槽位

三个档位的实测数据

档位推理 tokenSVG token总输出 token总耗时生成速度MTP 接受率视觉得分
Low4,4183,9668,387111.6 s75.4 t/s62.1%21.8 / 25
Medium5,9183,0388,959127.4 s70.5 t/s58.3%22.5 / 25
X-High39,3985,08544,487717.8 s62.0 t/s52.7%24.0 / 25

视觉得分由 Codex 给出。几个值得关注的数字:

  • 视觉得分最高档与最低档之间仅相差 2.2 分
  • xhigh 推理 token 数约为 low 的 9 倍,总耗时约为 low 的 6.4 倍
  • MTP 推测解码接受率随推理深度增加而下降,从 62.1% 降至 52.7%

结论与局限

原帖作者表示,xhigh 档位在视觉保真度上确实有明显优势,但代价是耗时显著拉长;low 与 medium 之间差距较小,速度与质量相对接近。作者自己也强调测试「不太科学」,仅作为社区参考。

对多数本地部署用户而言,medium 档位在速度与输出质量之间提供了较为均衡的折中。需要说明的是,该测试仅覆盖单一 prompt、单一量化版本与单一硬件配置,结论不宜直接外推到其他模型、其他任务或更高显存平台。

信源