桃子桃子快讯
返回首页
行业动态

Together AI:DeepSeek V4 Flash 编码任务成本约为 GPT-5.6 Luna 三分之一

Together AI 在 X 上称,在 DeepSWE 基准上两次 DeepSeek V4 Flash 尝试完成的任务…

2026.08.09 · 周日2 分钟阅读

Together AI 在 X 上发布的一项简要比对结果显示:在 DeepSWE 软件工程代理基准上,相同预算内两次 DeepSeek V4 Flash 尝试解决的问题数量超过一次 GPT-5.6 Luna 尝试,且总成本约为后者三分之一。

测试基准与方法

DeepSWE 是面向真实 GitHub issue 的端到端修复任务集,由普林斯顿等机构推出,常被用于评估语言模型在代码理解、修改与代理执行方面的综合能力。Together AI 此次将该基准用于比较 DeepSeek V4 Flash 与 GPT-5.6 Luna 两款模型的表现,但原帖未披露样本规模、随机种子、采样参数或具体任务数量,仅以一句话概述结论。

核心结论

按 Together AI 给出的口径:在 DeepSWE 上,两次 DeepSeek V4 Flash 尝试解决的问题数超过一次 GPT-5.6 Luna 尝试,同时总花费约为后者的三分之一。也就是说,用相同的预算,DeepSeek V4 Flash 在该基准上的「单位成本产出」更高。

局限与说明

  • 信源单一:原始内容仅为 Together AI 账号的一条 X 推文,未提供完整报告或可复现脚本,结论尚无法独立验证。
  • 商业立场:Together AI 自身提供 DeepSeek 系列模型的推理托管服务,本次对比对外宣传的属性较强,宜交叉对照其他独立评测再做判断。
  • 模型版本待核:DeepSeek V4 Flash 与 GPT-5.6 Luna 的具体型号及定价在两家厂商公开页面中暂未查到对应的正式发布记录,相关编号可能指代私有预览版或试验版本。

综上,这条推文可视为一项来自模型托管方的成本-产出对比信号,目前距离可被引用为行业基准的结论仍有较大距离。

信源