实测 9 款大模型:要求输出更简洁确实省钱,压缩输入提示反而更贵
研究者在 9 款大模型上测试输入与输出压缩策略,发现要求输出更简洁平均可省约 1.5 倍费用且保持准确率,而压缩输入提示…
大语言模型普遍偏冗长,而对调用方而言,唯一可控的只有输入内容和输出风格。近日 Claude Code 上线了「简洁输出」模式,将这一问题再次推到开发者面前。一项新研究系统性地测算了「缩短输入提示」与「让模型缩短输出」两种策略在多个主流大模型上的成本与准确率表现,给出了量化结论。
研究方法
研究团队在 9 款模型上做了对照实验,覆盖 GPT-4o、GPT-5.4、Claude Haiku 4.5、Claude Sonnet 4.6、Qwen2.5-VL-7B、Qwen3.5-9B、DeepSeek-R1-Distill、Gemma-4-E4B 和 Kimi-K2.6。评估维度包括:
- 5 个短答案数据集
- 10 种语言的输出测试(德语、西班牙语、法语、斯瓦希里语、中文、日语、俄语、孟加拉语、泰语、泰卢固语)
- 1 个长文本摘要任务
- 每个任务设置 5 个压缩等级
衡量指标包括费用、准确率,以及压缩后的文本是否仍与无约束回答的语义一致。
核心发现
缩短输出能省钱且不影响准确率。 在 API 模型上,要求模型给出更短的回答平均可节省约 1.5 倍费用,最佳情况下可达 3 倍。值得注意的是,这一效果在多种语言上均稳定有效。
缩短输入提示反而更贵更差。 压缩输入侧的效果与预期相反:在最差基准上费用反而上升了 96%。原因是模型会「补足」被裁掉的上下文,导致输出变长,费用上升的同时准确率反而下降。
输出 token 单价高于输入 token。 在单轮短任务场景下,主动约束输出长度具有结构性省钱优势。
压缩后的正确回答,约一半情况下推理路径已改变。 也就是说,答案虽然对,但模型得出该答案的过程与无约束回答明显不同。对只关心最终结论的用户来说这通常可接受,但如果需要稳定可解释的推理链,则需谨慎使用。
落地建议与局限
研究者特别提醒:部分厂商已在产品端内置「简洁模式」,但用户无法看到其计费方式,因此不能确认厂商是否真的按更少 token 收费。而通过 API 自行控制提示词时,节费效果是可验证的。
论文已发布在 alphaxiv(编号 2606.24083v1),代码与数据开源在 GitHub 仓库 danielle34/cavewoman,读者可自行复现实验。
