桃子桃子快讯
返回首页
行业动态

Qwen3.8-27B 开启 xhigh 思考:token 消耗 5.5 倍、耗时 6 倍

用户在 M5 Max 上测试 Qwen3.8-27B,开启 thinking xhigh 后 token 用量为关闭时的…

2026.08.30 · 周日2 分钟阅读

一名 Reddit 用户在 r/LocalLLaMA 板块分享了对 Qwen3.8-27B 在 Apple M5 Max MacBook Pro 上的测试结果,重点对比了「thinking xhigh」与「thinking off」两种模式在 token 消耗、推理耗时与输出质量上的差异。

测试环境

  • 硬件:Apple MacBook Pro M5 Max
  • 推理框架:oMLX
  • 模型:Qwen3.8-27B
  • 对比设置:thinking xhigh(全量高强度思考)vs thinking off(关闭思考)

用户将测试数据同步到了第三方基准平台 llm-bench.io,供其他用户查阅完整跑分明细。

量化对比结果

  • Token 消耗:开启 thinking xhigh 后,输出 token 数约为 thinking off 的 5.5 倍
  • 推理耗时:相应地,运行时间延长至约 6 倍
  • 输出质量:作者指出,关闭思考后模型输出质量出现明显下降,在多项任务上落后于 Qwen3.6-35B-A3B 等同类 MoE 模型。

这意味着对于该模型而言,推理质量与推理成本之间存在显著权衡。

与其他 MoE 模型的横向参照

  • 关闭思考时,Qwen3.8-27B 在质量上不及 Qwen3.6-35B-A3B 等结构相似但 token/秒更高的 MoE 模型。
  • 开启高强度思考后,token/秒与耗时劣势进一步放大,但对追求推理深度的场景仍具备价值。

对本地部署者的意义

对于希望在 Apple Silicon 上本地运行 Qwen 系列推理模型的用户,作者的实测提示了一个关键取舍点:

  • 若对响应速度与上下文窗口利用率敏感,可考虑保持 thinking off 或调整为中等档位。
  • 若任务对推理深度要求高,则需为 5–6 倍的 token 与时间开销做好预算。

该帖子也再次印证了 Qwen 系列在高强度推理模式下「思考成本极高」的社区共识,相关讨论此前已有多次出现。

信源