行业动态
Together AI 对比 Kimi K3 Max 与 GPT 5.6 Sol Max
Together AI 用 DeepSWE 基准测试两款模型,Kimi K3 Max 以约一半价格达到相近水平,二者组合…
2026.07.23 · 周四约 2 分钟阅读
AI 基础设施平台 Together AI 在 X 上发布了一项基于 DeepSWE 基准的软件工程任务对比结果,对象为月之暗面(Moonshot)的 Kimi K3 Max 与 OpenAI 系 GPT 5.6 Sol Max。结论显示,Kimi K3 Max 以大约 55% 的价格达到了与 GPT 5.6 Sol Max 相当的表现;更有意思的是,将两款模型组合使用时,整体性能可额外获得约 16% 的提升。Together AI 表示更多细节将在其推文串中展开。
基准与方法
Together AI 选用的 DeepSWE 是面向软件工程任务(代码生成、修改、调试等)的智能体基准,用于衡量模型在真实编程场景下的端到端表现。本次对比直接围绕两款模型在同等任务上的完成率与推理成本展开,结论以「价格等价」和「叠加增益」两种视角呈现。
关键数字
- 成本优势:Kimi K3 Max 在达到 GPT 5.6 Sol Max 同等水平时,成本约为后者的 55%,即便宜近一半。
- 组合增益:把两款模型配合使用,可带来约 16% 的额外性能提升,提示在工程任务上模型组合(ensemble / routing)仍有可观红利。
行业含义
对于在意推理成本与企业级部署的开发者而言,这一对比意味着在软件工程类工作负载中,价格更低的国产模型已具备替代或补足顶级闭源模型的实力;同时,「多模型协作优于单模型」的趋势,再次印证了 routing、cascade 等推理策略的实用价值。
注:以上结论来自 Together AI 在 X 上的简要披露,完整方法、数据样本与任务明细待其后续推文串与平台博客进一步公开。
