桃子桃子快讯
返回首页
行业动态

Together AI 对比 DeepSeek-V4 Flash 与 GPT-5.6 Luna:前者成本约 1/6,性能达八成

Together AI 使用 DeepSWE 基准对比两款模型,DeepSeek-V4 Flash-0731 以约 1/…

2026.08.07 · 周五2 分钟阅读

AI 基础设施厂商 Together AI 在 X 平台发文,宣布使用其 DeepSWE 基准,对 DeepSeek-V4 Flash-0731 与「GPT-5.6 Luna」两款模型在软件工程任务上的表现进行了对比分析。Together AI 给出的核心结论是:DeepSeek-V4 Flash-0731 在基准中达到 Luna 约 80% 的性能,而成本仅约为后者的六分之一。

测试方法

Together AI 表示,对比基于其内部开源的 DeepSWE 软件工程基准展开,用于评估模型在真实代码任务中的综合能力。原文未披露具体的测试集规模、任务类型分布、评分细则以及所采用的推理配置等关键参数,详细信息被引导至「帖子线程」中查看。

主要结果

依据原文披露的唯一量化结论:

  • DeepSeek-V4 Flash-0731 ≈ GPT-5.6 Luna 性能 × 80%
  • DeepSeek-V4 Flash-0731 成本 ≈ GPT-5.6 Luna × 1/6

也就是说,在 Together AI 的测算口径下,前者以约 17% 的成本实现了约 80% 的能力输出,性价比明显占优。但原文未给出绝对性能数值、token 单价或吞吐量等可比指标,结论的可验证性受限。

信息局限与参考提示

需注意几点:原文仅为社交媒体单条预告,完整数据与分析藏于后续线程;「DeepSeek-V4 Flash-0731」与「GPT-5.6 Luna」两款模型在主流公开渠道尚缺乏对应的官方发布信息,读者在引用该结论前宜进一步核实模型真实性、版本号及定价口径。Together AI 作为模型托管与推理服务商,其基准结果可能受限于特定推理栈与提示策略,未必完全反映模型在通用场景下的真实表现。

信源