Together AI 对比 DeepSeek-V4 Pro 与 GPT-5.6 等模型的 SWE 基准
Together AI 在 DeepSWE 基准上测试多款模型,DeepSeek-V4 Pro 0813 以更低成本达到…
Together AI 在社交平台 X 上发布了一项基于 DeepSWE 基准的软件工程任务对比分析,对象包括 DeepSeek-V4 Pro 0813、GPT-5.6 Sol 与 Fable 5 三款模型。DeepSWE 是一套用于评估大模型在真实软件工程任务上表现的测试框架,覆盖代码改写、缺陷修复等场景。
基准结果概览
根据 Together AI 公布的数据,DeepSeek-V4 Pro 0813 在该基准上达到了 88.5% 的 pass@4 成绩,同时单任务成本仅 0.24 美元。作为对比,GPT-5.6 Sol 的单任务成本约为 DeepSeek 的 35 倍,Fable 5 的单任务成本约为其 90 倍。
- DeepSeek-V4 Pro 0813:88.5% pass@4,单任务成本约 0.24 美元
- GPT-5.6 Sol:单任务成本约为 DeepSeek-V4 Pro 0813 的 35 倍
- Fable 5:单任务成本约为 DeepSeek-V4 Pro 0813 的 90 倍
Together AI 表示,更详细的分析内容将在原帖的 thread 中陆续公布。
关于模型名称的说明
需要指出的是,DeepSeek 目前公开的版本仍为 V3 系列及 R1 系列,「V4 Pro 0813」并非其官方已发布的型号;OpenAI 公开产品线中亦未出现「GPT-5.6 Sol」这一编号;「Fable 5」同样不是业界广为认知的主流模型。这些名称可能指向 Together AI 内部或合作渠道获取的未公开版本,但截至目前并无对应的官方文档、模型卡或论文支撑。读者在引用上述数字时,需注意其来源仅为单一社交媒体帖文,未经第三方独立复现。
行业关注点
若数据属实,这项对比凸显了大模型在软件工程任务上的成本差异正在显著扩大。对于希望在 CI/CD 流程、自动化修复或大规模代码改写场景中部署模型的团队而言,单任务成本与通过率的综合权衡是关键指标。近年来,开源权重模型在 SWE 类基准上的追赶速度明显加快,性价比指标也成为继 benchmark 跑分之后的重要参考维度。
