工具
社区实测:Qwen 3.8 27B 多种量化与推理模式 agentic coding 跑分对比
Reddit 用户对 Qwen 3.8 27B 在不同权重量化、缓存量化、推理引擎与推理强度下做 agentic cod…
2026.08.18 · 周二约 3 分钟阅读
一位 Reddit 用户(u/WonderRico)近日发布了针对 Qwen 3.8 27B 的本地 agentic coding 基准测试,覆盖多种权重量化、缓存量化、推理引擎以及不同推理强度档位,并与其他本地模型做了对比。测试方法、数据图表均已公开,供社区进一步核实与复现。
测试对象与变量
- 模型:Qwen 3.8 27B,并横比若干其他本地模型。
- 变化维度:不同权重量化(quants)、缓存量化(cache quants)、推理引擎(engine)、推理强度(reasoning effort)。
- 任务类型:agentic coding,强调多轮请求与长上下文中的工具调用与代码生成。
medium 模式:效率与质量兼得
在 medium 推理强度下,Qwen 3.8 27B 同时取得了两项改善:
- 跑分高于同系列的 3.6 版本。
- 资源消耗明显下降,约只需 3.6 的一半请求数,生成 token 量减少约三分之一。
- 综合表现可对标被标注为「DeepSeek v4 Flash 3107 MXFP4」的对照水平。
作者认为,medium 才是该模型在 agentic coding 场景下的「甜点档」。
xhigh 模式:成本上升、收益不显
xhigh 是官方宣传中面向难题的更强档位,但本基准显示:
- 得分与 medium 相比基本持平,未观察到明显增益。
- 请求数仍略少于 3.6 版本,但生成 token 量几乎是 medium 的四倍。
- 性价比明显劣于 medium。
作者推测 xhigh 更适合单轮、一次性提示词类任务,也就是新模型发布后社区常见的「单题测试」。
一点值得注意的异常
在测试中,使用 NINFER 推理引擎、显式配置为 medium 时,其表现与 xhigh 几乎一致。作者已三次核对配置,但不排除用户侧配置错误的可能性,留待社区进一步排查。
复现与扩展
- 主结果页:https://wonderrico.github.io/local_llm_benchmark/benchmark-main.html?filter=27b
- 明细节页:https://wonderrico.github.io/local_llm_benchmark/benchmark-detail.html?filter=27b
页面上提供了更多模型、更多量化与更多任务的数据和曲线,感兴趣的读者可自行查阅。需要说明的是,「Qwen 3.8 27B」与「DeepSeek v4 Flash 3107」均为帖中用语,社区尚未见到对应版本的正式发布说明,相关数据应理解为该用户的本地环境实测结果,而非官方基准。
