行业动态
Together AI 基准对比:同预算下 GLM-5.3 解题数为 Fable 5 五倍
Together AI 在 X 平台公布 DeepSWE 基准测试结果:给予 GLM-5.3 与 Fable 5 各 1…
2026.08.24 · 周一约 3 分钟阅读
AI 推理与算力服务商 Together AI 近日在 X 平台发布了一组对比数据:在 DeepSWE 智能体软件工程基准测试中,给予 GLM-5.3 与 Fable 5 相同的 100 美元预算,GLM-5.3 完成的任务数量约为 Fable 5 的 5 倍以上。这一数据点凸显了在大模型智能体(agent)场景下,单位预算能解决的问题数量是衡量模型实用性的重要维度。
核心数据:同预算、不同产出
Together AI 在推文中披露的关键数字如下:
- 预算:两个模型各分配 100 美元。
- DeepSWE 任务完成数:GLM-5.3 约完成 17 个任务,Fable 5 仅完成约 3 个任务。
- 效率差距:GLM-5.3 完成的任务量超过 Fable 5 的 5 倍。
- 单次表现:推文特别指出,两者在「第一次尝试」中的表现「几乎相同」,但 GLM-5.3 在多轮或长时任务中展现出了更高的成本效率。
换言之,若仅看单次成功率,两者差距有限;但引入预算约束与多轮迭代后,GLM-5.3 的工程化能力明显领先。
背景:DeepSWE 基准
DeepSWE 是一类聚焦于软件工程任务的智能体评测基准,用于评估模型在多轮交互、工具调用、代码修改与验证等场景下的综合表现。它和 SWE-bench 系列同属「代理式编码」(agentic coding)评测范畴,近年来已成为衡量大模型在真实开发任务中实用价值的重要参照。本次推文强调「同预算解题数」,对应的是智能体框架下 token 调用、工具成本与任务完成率共同决定的经济性指标。
意义与局限
这一对比对正在选型智能体开发平台的团队有一定参考价值:即便两个模型首轮表现接近,单位预算能解决的问题数仍可能拉开数量级差距,从而直接影响生产环境中的部署成本。
不过需要注意以下几点:
- 数据来源单一:目前结果仅由 Together AI 在其 X 账号披露,尚未见到第三方独立复现。
- 「GLM-5.3」与「Fable 5」的具体版本、上下文窗口及工具配置未在推文中给出,读者难以直接对比参数。
- DeepSWE 只是众多智能体基准之一,结果未必可外推到其他编码或通用任务。
- Together AI 本身提供算力与推理服务,存在一定商业推广动机。
需要更全面的判断,建议结合模型官方发布说明、第三方评测社区(如 Hugging Face、SWE-bench 排行榜)以及自有业务场景的复测结果综合评估。
