桃子桃子快讯
返回首页
模型发布

智谱 GLM-5.3 在 DeepSWE 基准以更低成本领先 Fable 5

Together AI 公布对比数据,GLM-5.3 在 DeepSWE 基准上以 87.6% 解题率与约 16 美元成…

2026.08.23 · 周日2 分钟阅读

AI 推理平台 Together AI 在 X 平台发布了一组模型对比数据,展示了智谱 GLM 系列新模型 GLM-5.3 在软件工程任务基准 DeepSWE 上的表现,并与对标对象 Fable 5 进行了多项指标对照。这是 GLM-5.3 首次以具体成绩出现在公开讨论中,但目前披露的信息仍以平台方口径为主。

基准成绩

根据其披露的数据,GLM-5.3 在 DeepSWE 上的关键指标如下:

  • 解题率:87.6%
  • 完成任务的估算成本:约 16 美元

与之对比的 Fable 5 表现则为:

  • 解题率:69.7%
  • 完成任务的估算成本:约 21.63 美元

Together AI 同时表示,在「四次尝试」这一设定下,GLM-5.3 在解题率和总成本两个维度上均优于 Fable 5。

对比所反映的成本效率

若仅看这一组数字,GLM-5.3 的优势体现在两个方向:

  • 绝对完成率高出约 17.9 个百分点
  • 单次任务成本低约 5.63 美元,降幅约 26%

这意味着在 DeepSWE 这一以真实仓库 issue 为评测对象的场景下,GLM-5.3 同时跑出了更高的通过率与更低的经济成本,属于「性能/价格比」层面的双重领先。

需要注意的边界

  • 数据来源为 Together AI 在 X 平台的一则短帖文,并非智谱官方发布的完整技术报告。
  • 评测口径(具体采样方式、运行配置、token 计费标准等)未在原帖中详述,外部读者难以复现。
  • 「Fable 5」的具体身份、是否开源、是否同样在 Together AI 上推理,目前尚无明确披露。
  • 模型是否已正式发布、可被第三方调用,也仍需智谱方面后续确认。

综合来看,这条动态提供了 GLM-5.3 在 DeepSWE 上的一个明确锚点,但作为正式发布或权威评测信息仍显单薄,建议关注智谱官方与 Together AI 后续更完整的技术说明。

信源