用户为 27B 模型自制「high」推理档位,推理长度缩至 xhigh 约五分之一
Reddit 用户测试发现 27B 模型 medium 档位异常,自制混合 high 档位提示词,推理块约为 xhigh…
一名 Reddit 用户在 r/LocalLLaMA 板块分享了对某款 27B 参数模型(推理模式与档位命名疑似 Qwen3 系列)reasoning_effort 参数的实测结果,并自制了一个介于 low 与 xhigh 之间的「high」档位。该方案在 VLLM 等本地推理框架中可直接通过修改 chat 模板启用。
core 发现:medium 档位并非真正的「中等」
用户在测试中发现,模型官方提供的 medium 推理模式存在异常行为:启用 medium 后,原始的显式推理指令会被擦除,模型整体表现回退到接近旧版本的状态,并丢失新版本的部分能力增益。换言之,medium 档并非一个力度居中的折中档,而更像是一次隐式的行为切换。
low 与 xhigh 呈现明显的「二元」特征
进一步观察表明,模型在 low 与 high(xhigh)之间的切换几乎完全由推理指令中的特定关键词触发,表现为「几乎二元」的行为模式。无论是补充额外的约束、调整提示词措辞,还是在指令中明确要求「中等努力程度」,模型都会忽略这些改动,无法稳定地输出中等长度的推理。
自制 high 档:混合 low 与 xhigh 提示词
基于上述观察,用户尝试将 low 与 xhigh 两套提示词按比例混合,得到一组新的 high 档位指令,核心要点包括:
- 将推理力度目标设定为「介于 low 与 xhigh 之间」
- 要求「仔细但简洁地思考」
- 验证关键假设,但保持简短
- 快速推进到结论,避免不必要的展开
实测效果方面,新 high 档生成的推理块长度大约只有 xhigh 的五分之一,输出质量更接近 xhigh 而非 low 或 medium;同时由于推理更短,整体响应速度明显提升,使用体验更流畅。
启用方式与适用边界
用户同步给出了在 VLLM 等框架下启用 high 档的 chat 模板修改片段:需在 reasoning_effort 的白名单校验中加入 high 分支,并在对应分支填入上述混合提示词。需要注意的是:
- 该方案基于特定 27B 模型的内部 token 触发机制,对其他尺寸或架构的模型不一定有效
- 实际效果会因采样参数、量化方案与具体版本而异
- 属于社区实验性质的 prompt hack,并非模型官方支持的功能
对本地部署 27B 模型、追求更低延迟与更短 reasoning 输出的用户来说,这是一个值得尝试的轻量改动。
