桃子桃子快讯
返回首页
工具

社区发布 Qwen 3.5/3.6/3.8 修复版聊天模板

Reddit 用户指出 Qwen 官方 Jinja 模板存在崩溃、对话污染等 Bug,推出社区修复版并支持推理强度调节。

2026.08.14 · 周五3 分钟阅读

近期 Qwen 团队发布了首个 3.8 版本模型,其新增的「推理强度可控」功能允许通过 reasoning_effort 参数调节模型思考深度。然而,社区开发者反映官方 Jinja 聊天模板存在多处严重 Bug,会导致本地部署时的崩溃、对话污染和工具调用失败。为此,用户 froggeric 在 Hugging Face 上线了一份覆盖 Qwen 3.5、3.6 和 3.8 的统一修复模板,供本地推理用户替换使用。

官方模板存在的关键问题

根据该开发者的梳理,Qwen 3.8 官方 Jinja 模板主要存在四类故障:

  • 无法关闭思维链:当调用方传入 enable_thinking=false 时,3.8 模型会直接抛出硬性异常,而非回退到普通回答。
  • 多轮对话污染:在多轮对话中,官方模板会在真实推理内容之前注入空白的 <think></think> 标签,干扰后续轮次。
  • 工具调用崩溃:若客户端以 JSON 字符串形式(OpenAI 标准 API 格式)传入参数,模板会报错。
  • Agent 卡死:在多步工具调用链路中,官方模板常丢弃中间轮次的系统消息,导致 Agent 流程停滞。

修复模板的核心改进

社区版本在保持向后兼容的前提下,针对上述问题做了系统性修复,主要特性包括:

  • 完整支持 3.8 推理强度调节:可通过 reasoning_effort 在 xhigh、high、medium、low 四档之间切换。
  • 恢复思维链开关:既支持通过参数关闭推理,也可在 prompt 中直接输入 <|think_off|> 触发快速回答。
  • 100% KV Cache 命中:默认保留历史推理内容,确保多轮对话中前缀缓存保持命中,降低重复计算开销。
  • llama.cpp 原生适配:支持新增的 --reasoning-preserve 标志。
  • 通用工具解析:兼容 Python 字典和 JSON 字符串两种参数形式,可在 llama.cpp、vLLM、LM Studio、MLX 上使用。

推荐启动方式

开发者给出了 llama.cpp 下的推荐启动命令:

  • llama-server -m your_model.gguf --jinja --chat-template-file chat_template.jinja --reasoning-format deepseek

其中 --reasoning-format deepseek 会将思考内容单独输出至 OpenAI 兼容的 reasoning_content 字段,避免 OpenCode、Claude Code 等下游工具因直接遇到原始思维链 token 而卡住。

测试情况与硬件提醒

该模板通过了全部 28 项自动化测试与 tokenizer 一致性校验,但开发者也坦诚说明:受限于本地硬件条件,无法在 2.4 万亿参数规模的 Qwen 3.8 模型上做端到端实测,因此欢迎具备条件的用户在真实环境中反馈问题。修复模板已在 Hugging Face 仓库 froggeric/Qwen-Fixed-Chat-Templates 开源,可作为官方模板的直接替代品部署。

信源