桃子桃子快讯
返回首页
工具

社区实测:Qwen 3.8 27B 多种量化与推理模式 agentic coding 跑分对比

Reddit 用户对 Qwen 3.8 27B 在不同权重量化、缓存量化、推理引擎与推理强度下做 agentic cod…

2026.08.18 · 周二3 分钟阅读

一位 Reddit 用户(u/WonderRico)近日发布了针对 Qwen 3.8 27B 的本地 agentic coding 基准测试,覆盖多种权重量化、缓存量化、推理引擎以及不同推理强度档位,并与其他本地模型做了对比。测试方法、数据图表均已公开,供社区进一步核实与复现。

测试对象与变量

  • 模型:Qwen 3.8 27B,并横比若干其他本地模型。
  • 变化维度:不同权重量化(quants)、缓存量化(cache quants)、推理引擎(engine)、推理强度(reasoning effort)。
  • 任务类型:agentic coding,强调多轮请求与长上下文中的工具调用与代码生成。

medium 模式:效率与质量兼得

在 medium 推理强度下,Qwen 3.8 27B 同时取得了两项改善:

  • 跑分高于同系列的 3.6 版本。
  • 资源消耗明显下降,约只需 3.6 的一半请求数,生成 token 量减少约三分之一。
  • 综合表现可对标被标注为「DeepSeek v4 Flash 3107 MXFP4」的对照水平。

作者认为,medium 才是该模型在 agentic coding 场景下的「甜点档」。

xhigh 模式:成本上升、收益不显

xhigh 是官方宣传中面向难题的更强档位,但本基准显示:

  • 得分与 medium 相比基本持平,未观察到明显增益。
  • 请求数仍略少于 3.6 版本,但生成 token 量几乎是 medium 的四倍。
  • 性价比明显劣于 medium。

作者推测 xhigh 更适合单轮、一次性提示词类任务,也就是新模型发布后社区常见的「单题测试」。

一点值得注意的异常

在测试中,使用 NINFER 推理引擎、显式配置为 medium 时,其表现与 xhigh 几乎一致。作者已三次核对配置,但不排除用户侧配置错误的可能性,留待社区进一步排查。

复现与扩展

页面上提供了更多模型、更多量化与更多任务的数据和曲线,感兴趣的读者可自行查阅。需要说明的是,「Qwen 3.8 27B」与「DeepSeek v4 Flash 3107」均为帖中用语,社区尚未见到对应版本的正式发布说明,相关数据应理解为该用户的本地环境实测结果,而非官方基准。

信源