行业动态
Together AI:DeepSWE 基准显示 DeepSeek 级联方案单任务成本降 37%
Together AI 在 DeepSWE 基准上测试 DeepSeek V4 Flash 与 GPT-5.6 Luna…
2026.08.08 · 周六约 2 分钟阅读
AI 基础设施厂商 Together AI 在社交平台 X 上发文,公布其基于代码任务基准 DeepSWE 的最新对比结果。测试对象为 DeepSeek V4 Flash 与 GPT-5.6 Luna 两个模型,并尝试了一种「DeepSeek 优先」的级联(cascade)调用方案:在初步阶段由 DeepSeek V4 Flash 处理,必要时再调用 GPT-5.6 Luna,并通过测试套件验证(test-suite verification)确认结果。
核心结论
Together AI 给出的关键数据如下:
- 在 DeepSWE 基准上,DeepSeek 优先级联 + 测试套件验证的方案,最终成功完成的任务数量高于单独使用 GPT-5.6 Luna。
- 单任务成本方面,级联方案相比 Luna 单独运行降低约 37%。
Together AI 强调,这一结果支持其一直倡导的级联推理路线:通过廉价模型先行筛选、复杂模型兜底验证,可在保持解题质量的同时显著压缩推理开销。
需要注意的局限
目前 Together AI 仅以一条社交媒体推文的形式披露结论,原文未公开以下关键信息:
- DeepSWE 基准的题目数量、具体子集与通过率定义。
- 级联方案中两个模型的调用阈值与切换条件。
- 单任务成本的计算口径(是否含测试套件验证开销、API 价格取值等)。
此外,文中提到的「DeepSeek V4 Flash」与「GPT-5.6 Luna」并非目前公开确认的模型名称,疑为 Together AI 平台上的内部代号或预览版本,读者在引用时应留意版本来源与命名含义。
行业背景
级联推理(model cascading)是 2024 年以来推理成本优化的常见做法之一:在多模型系统中用小模型/便宜模型先做意图识别或初答,置信度不足时再升级到大模型。Together AI、Anyscale、OpenAI 等厂商均提供过类似方案。本次数据若口径可核实,对于关注代码生成 Agent 部署成本的开者与企业具有参考价值;否则仅作为厂商自测案例看待即可。
