行业动态
Qwen3.8-27B 开启 xhigh 思考:token 消耗 5.5 倍、耗时 6 倍
用户在 M5 Max 上测试 Qwen3.8-27B,开启 thinking xhigh 后 token 用量为关闭时的…
2026.08.30 · 周日约 2 分钟阅读
一名 Reddit 用户在 r/LocalLLaMA 板块分享了对 Qwen3.8-27B 在 Apple M5 Max MacBook Pro 上的测试结果,重点对比了「thinking xhigh」与「thinking off」两种模式在 token 消耗、推理耗时与输出质量上的差异。
测试环境
- 硬件:Apple MacBook Pro M5 Max
- 推理框架:oMLX
- 模型:Qwen3.8-27B
- 对比设置:thinking xhigh(全量高强度思考)vs thinking off(关闭思考)
用户将测试数据同步到了第三方基准平台 llm-bench.io,供其他用户查阅完整跑分明细。
量化对比结果
- Token 消耗:开启 thinking xhigh 后,输出 token 数约为 thinking off 的 5.5 倍。
- 推理耗时:相应地,运行时间延长至约 6 倍。
- 输出质量:作者指出,关闭思考后模型输出质量出现明显下降,在多项任务上落后于 Qwen3.6-35B-A3B 等同类 MoE 模型。
这意味着对于该模型而言,推理质量与推理成本之间存在显著权衡。
与其他 MoE 模型的横向参照
- 关闭思考时,Qwen3.8-27B 在质量上不及 Qwen3.6-35B-A3B 等结构相似但 token/秒更高的 MoE 模型。
- 开启高强度思考后,token/秒与耗时劣势进一步放大,但对追求推理深度的场景仍具备价值。
对本地部署者的意义
对于希望在 Apple Silicon 上本地运行 Qwen 系列推理模型的用户,作者的实测提示了一个关键取舍点:
- 若对响应速度与上下文窗口利用率敏感,可考虑保持 thinking off 或调整为中等档位。
- 若任务对推理深度要求高,则需为 5–6 倍的 token 与时间开销做好预算。
该帖子也再次印证了 Qwen 系列在高强度推理模式下「思考成本极高」的社区共识,相关讨论此前已有多次出现。
