Qwen 3.8 27B 开源发布,默认推理等级过深需手动调低
阿里通义千问发布 Apache 2 协议开源的 27B 视觉语言模型 Qwen 3.8,但默认 reasoning_ef…
阿里巴巴通义千问实验室发布了视觉语言模型 Qwen 3.8 27B,采用 Apache 2 协议开源,参数规模 27B,可在配置较好的笔记本上本地运行。独立开发者 Simon Willison 在 M5 Max MacBook Pro 与 NVIDIA DGX Spark 上实测后发现,该模型官方默认将 reasoning_effort 设为 xhigh,对最简单任务也会严重过度思考,实测建议用户将推理等级调低再使用。
模型基本情况
Qwen 3.8 27B 是阿里通义千问研究实验室于本周五发布的新模型,支持视觉输入,采用 Apache 2 许可证开源。27B 参数规模属于可在消费级笔记本上本地运行的甜点区间,其前代 Qwen 3.6 27B 在本地社区中口碑不错。
通义千问官方基准测试显示,Qwen 3.8 27B 性能较 Qwen 3.6 27B 以及今年 5 月仍属顶尖的闭源 Qwen 3.7-Plus 均有提升。Willison 表示,独立第三方基准测试结果将更具参考价值。
他主要在两台设备上测试:128GB 内存的 M5 Max MacBook Pro,以及一台 NVIDIA DGX Spark;主要使用 LM Studio 提供的 Q4_K_M 量化版本,文件大小约 17GB,在 DGX Spark 上他也尝试过直接使用 llama-server。
默认 xhigh 导致严重过度思考
通义千问官方文档说明 Qwen 3.8 默认将 reasoning_effort 设为 xhigh,LM Studio 提供的 GGUF 量化版本保留了这一默认值。Willison 认为这是一个「非常糟糕的默认」,在消费级硬件上尤其不合适。
实测对比一:让模型「画一个骑自行车的鹈鹕 SVG」。在默认 xhigh 设置下,模型消耗 22,276 个推理 token 生成 3,223 个输出 token,整个过程耗时约 21 分钟;同一请求关闭推理后,仅用约 137 秒便产出 3,715 个 token 的结果。
实测对比二:让模型「画一个圆的 SVG」。即便如此简单的请求,模型也花了数分钟「精心设计」,最终产出一个带有动画、多层同心圆与几何研究风格的 SVG——远超用户预期。
此外,LM Studio 默认上下文窗口只有 8,192 token,远不够用;将上下文调至模型最大支持的 262,144 token 后,问题得到缓解。Willison 的结论是:初次使用 Qwen 3.8 27B 时,应将推理等级调至 low 或完全关闭,才能获得合理的响应速度。
视觉能力与工具构建
Willison 还测试了模型的视觉能力,要求它对一张鹈鹕照片返回 0-1000 比例的边界框 JSON。模型成功输出两个边界框,坐标分别为 [195, 290, 370, 780] 和 [445, 320, 675, 850],渲染后与原图中鹈鹕位置非常吻合,延续了此前 Qwen 模型在边界框任务上的强项。
他随后让模型基于该 JSON 数据,直接从一条 prompt 构建一个用于标注边界框的 HTML 页面工具。虽然因为没有调低推理而出现「过度工程化」现象,模型最终仍然产出了一个完整的可视化界面,展示了其在视觉理解与代码生成上的综合能力。
整体而言,Qwen 3.8 27B 是一款能力强、可在本地硬件运行的优秀视觉语言模型,但其默认 xhigh 推理设置在消费级硬件上几乎不可用,建议用户在第一次使用时便手动将推理等级调低。
