实验显示:两阶段路由架构比单次大模型调用更便宜且更准
独立研究「语义热力学」二期实验表明,用小模型先压缩任务再交给大模型执行,比一次性喂 8K 长 prompt 更省钱、更准…
一项名为「语义热力学(Semantic Thermodynamics)」的独立研究项目发布了第二期实验结果:在企业邮件信息抽取任务中,采用「小模型语义路由 + 大模型执行」的两阶段动态路由架构,比直接把 8K token 的系统提示一次性喂给大模型的单次调用方案,整体成本下降约 67.5%,材料准确率从 72% 提升到 100%,运营级端到端耗时下降约 86%。研究同时强调,该架构并非取代单次调用,而是把 prompt 设计的关注点从「接口格式」转向「推理行为」。
研究背景与术语框架
项目作者将 prompt 结构视为一种「推理基础设施变量」,提出四个核心概念:Narrative Gravity(叙事引力,即语义约束密度)、Narrative Pruning(叙事剪枝,缩小输出相空间)、Structural Friction(结构摩擦,过度约束反而劣化效果)以及 Entropic Proportionality(熵比例定律,结构最优而非最大)。其首期实验显示,对一段高熵请求加上语义约束后,输出 token 减少 79.29%,平均端到端延迟下降 60.73%,而最终答案保持一致。第二期实验则把视角从 prompt 层面推到系统架构层面。
实验二:两种架构的对决
实验对象是一项企业邮件字段抽取任务,作者预先注册了 50 组配对观测。
- Route A(静态指令堆叠):单次调用 gpt-4o-2024-11-20,输入包含一份模拟「企业系统提示」的 8,192 token 长文档(覆盖安全、合规、隐私、法律、格式、语气、审计等通用条款)、一段嘈杂的用户请求,以及一段混乱的邮件线程。
- Route B(动态语义路由):先由 gpt-4o-mini-2024-07-18 担任「语义微路由器」,只接收用户请求并将其压缩为「Persona / Objective / Scope / Negative Constraints / Output Matrix」五要素叙事公式;再由 gpt-4o-2024-11-20 作为执行器,只接收该公式与原始邮件线程。
两种方案任务目标相同,仅在「如何把任务交给大模型」这一环节不同。
关键结果
- Token:Route A 单次管道平均 10,282.28 tokens;Route B 平均 2,624.84 tokens,下降 74.47%,50/50 组全部胜出。
- 成本(开启 prompt 缓存):Route A 单次抽取约 0.01362 美元;Route B 约 0.00442 美元,下降 67.54%。
- 材料准确率:Route A 仅 36/50 通过(72%,14 次实质性抽取失败);Route B 50/50 全通过(100%)。
- 服务延迟:Route A 均值 2.257 秒,Route B 均值 3.246 秒(多了一次推理),但 Route B 的 p95 反而更低(4.359 秒 vs 6.383 秒)。
- 运营级墙钟时间:在作者所在项目的实际速率约束下,Route A 均值 24.202 秒,Route B 仅 3.284 秒,下降 86.43%。原因是大模型单次请求反复逼近 token-per-minute 上限,被准入控制反复降级。
一次「先失败的实验」
项目最初未接入速率感知的准入控制,在 150 次 API 调用中遭遇 69 次 HTTP 429,Route A 仅 3/50 完整完成,Route B 的微路由器 50/50 完成、执行器仅 28/50 完成。这一经历也反向印证了 Route A 把大模型置于长 prompt 下的脆弱性。
启示与局限
作者的核心结论是:把大模型放进一个由小模型动态构造的「任务专属语义场」里,比把通用政策层塞进系统提示更经济、更稳。该结论对自建企业级 LLM 管道的团队有借鉴价值,尤其是在速率受限、prompt 长期膨胀的生产环境中。但需注意:实验仅基于 GPT-4o 系列、单一抽取任务、合成数据集,且作者明确声明那 8K token 的「企业系统提示」是压力测试道具,不代表任何公司真实生产 prompt。结果的可迁移性仍需在更多模型与任务上验证。
