桃子桃子快讯
返回首页
模型发布

社区实测:Qwen3.8-27B 知识召回能力较 3.6 出现明显下滑

Reddit 用户在多个量化档位下测试 Qwen3.8-27B,发现其离线知识问答准确率较 Qwen3.6 显著下降,代…

2026.08.20 · 周四2 分钟阅读

近期在 r/LocalLLaMA 社区,有用户针对 Qwen 系列最新 27B 量级模型「Qwen3.8-27B」进行了多量化档位、多采样设置的横向测试。结果显示,该模型在离线知识问答场景下的表现较前代 Qwen3.6 出现明显下滑,召回随机事实的准确率下降幅度可观,但在代码生成等任务上仍保持可用水平。

实测背景与测试方法

测试者长期使用同一套私人 trivia 题集作为小型个人基准,题目涵盖个人关心的偏冷门知识点,并夹杂少量实用类问题。在 Qwen3.6 上,这套题集能够稳定给出正确答案;而切换到 Qwen3.8-27B 后,无论是改变量化精度还是采样参数,模型在该题集上的通过率均显著下降,部分原本能答对的题目开始出现事实性错误或拒绝回答。

与公开基准的对照

测试者进一步查阅了多个不依赖工具调用的离线知识评测榜单,发现 Qwen3.8-27B 在随机事实召回类任务上的得分整体低于 Qwen3.6,与本人主观体感一致。需要说明的是,幻觉率方面的主观改善并未在所引用的榜单中明显体现,因此目前仅能确认「事实召回」这一维度的退步,而非「减少编造」这一维度的提升。

影响范围与使用建议

该退步主要影响以下使用场景:在断网或纯本地推理环境下,依赖模型自身权重回答偏冷门、广覆盖的事实类问题。测试者指出,这种「离线权重即知识库」的策略本身已存在明显局限,更稳妥的方案是为模型接入 MCP 服务器等外部工具调用通道。对于主要使用 Qwen3.8-27B 进行代码生成、对话交互或已配合工具调用的用户,这一退化影响有限。

社区讨论与待验证问题

该帖在评论区引发讨论,部分用户反馈在自己常用的评测集上观察到类似现象,也有用户认为差异在可接受范围内。由于目前缺少官方对比数据与权重层面的变更说明,结论仍属社区层面的经验性观察,建议关注 Qwen 团队后续是否会就模型训练数据与微调策略发布说明。

信源