桃子桃子快讯
返回首页
研究论文

τ³-Banking 榜单:Qwen 3.8 Max 登顶,26 款主流模型排名一览

τ³-Banking 榜单覆盖 26 款模型,Qwen 3.8 Max 以 55.2% 居首,Claude Opus 5…

2026.08.20 · 周四4 分钟阅读

τ³ 系列基准最新发布的 Banking 榜单汇总了 26 款主流大模型在银行客服任务中的表现。该任务要求文本 Agent 在约 700 篇文档构成的知识库中解答银行业客服问题,评测指标为 pass@1。榜单采用统一 gpt-5.2 作为 User Sim,并支持 Standard 与 Custom 两种配置。

榜单前三名

排名第一的是 Qwen 3.8 Max(2026-07-19 发布),在 alltools 检索 + xhigh 推理配置下取得 55.2% 的 pass@1。Claude Opus 5(2026-07-24,max 推理)以 48.7% 紧随其后,xAI 的 Grok 4.5(2026-07-16,high 推理)以 47.9% 位列第三。前三名之间的差距在 1–7 个百分点之间,反映出当前头部模型在长文档客服任务上的表现仍存在明显梯队。

  • #1 Qwen 3.8 Max — 55.2%(xhigh)
  • #2 Claude Opus 5 — 48.7%(max)
  • #3 Grok 4.5 — 47.9%(high)

后续梯队与厂商分布

第 4 至第 10 名覆盖 OpenAI、Meta、Anthropic 等厂商的最新版本:

  • GPT-5.6-sol:46.9%(#4)
  • GPT-5.5:44.6%(#5)
  • Muse Spark 1.1(Meta):40.5%(#6)
  • Claude Opus 4.7:40.2%(#7)
  • Claude Opus 4.8:39.7%(#8)
  • Claude Fable 5:39.7%(#9)
  • GPT-5.4:39.4%(#10)

OpenAI 系(GPT-5.x 系列)共 4 款进入前 10;Anthropic 系(Claude Opus 系列)共 4 款;Meta 与 xAI 各 1 款。国产模型方面,Kimi K3(Moonshot AI)以 37.1% 排在第 11 位,与 GLM-5.2(Z.ai,37.1%)并列。

发布时间线与趋势

榜单按模型公开发布日期绘制了 pass@1 演化曲线,从 2025-06 的 Gemini 2.5 Pro(13.7%)起步,逐月攀升至 2026-07 的 Qwen 3.8 Max(55.2%)。关键跃升点包括:

  • 2025-12:GPT-5.2 将成绩推至 32.2%,首次突破 30%。
  • 2026-04:Claude Opus 4.7 跨过 40%。
  • 2026-07:Qwen 3.8 Max 与 Grok 4.5 在两周内将上限抬升约 7 个百分点。

整体趋势显示,过去 13 个月内 Banking 任务的 pass@1 上限从 13.7% 提升至 55.2%,提升幅度超过 40 个百分点。

配置差异与个别观察

榜单同时记录了 Retrieval(alltools / Terminal)与 Reasoning(none / high / xhigh / max)的配置组合。值得注意的是,GPT-5.2 在不同检索设置下表现差异显著:alltools 配置为 32.2%,而切换至 qwen_embeddings 时降至 12.6%;GLM-5 与 Qwen3.5-397B-A17B 在使用 text-emb-3-large 时得分均仅 9.8%,提示检索后端对最终成绩有较大影响。

榜单方也开放提交通道,新结果可通过提交 JSON 文件并发起 Pull Request 加入评测。

信源