桃子桃子快讯
返回首页
模型发布

Agnes AI 发布 2.5 Pro Beta:智能指数升至 49,智能体能力大幅提升

新加坡 Agnes AI 推出 2.5 Pro Beta 预览版,智能指数从 40 升至 49,智能体能力翻倍,但输出…

2026.08.28 · 周五3 分钟阅读

新加坡 AI 实验室 Agnes AI 近日推出全模态基础模型 2.5 Pro 的 Beta 预览版本。该版本在 Artificial Analysis 智能指数(Intelligence Index)上取得 49 分,较前代 2.5 Pro Alpha 的 40 分提升 9 个点位,已接近前沿梯队,但仍落后于 Gemini 3.5 Flash(high,52)和 GPT-5.6 Luna(max,52),领先于 MiniMax-M3(45)。模型支持文本与图像输入、文本输出,提供免费的全模态 API。

智能体能力是主要拉动项

Agnes 2.5 Pro Beta 最大的进步集中在智能体任务上。Artificial Analysis 智能体指数(Agentic Index)从 25 跃升至 44,仅次于 Gemini 3.7 Flash(high,45),超过 Gemini 3.5 Flash(high,40)和 MiniMax-M3(36)。

  • τ³-Banking 得分从 12% 提升至 36%,接近翻三倍。
  • GDPval-AA v2 相对人类基线(Elo 1000)的得分从 1171 升至 1456,已超过 MiniMax-M3(1384),逼近 GPT-5.5(xhigh,1489)和 Gemini 3.7 Flash(high,1527)。

相比之下,前沿推理类基准提升幅度较小:Humanity's Last Exam 由 34% 升至 38%,GPQA Diamond 由 88% 升至 91%,CritPt 由 11% 升至 16%。

知识类指标改善源于「拒答」而非准确率

AA-Omniscience 分数由 -25 改善至 -11,但提升主要来自模型更频繁地选择不回答,而非答对更多问题。新版本仅尝试回答 45% 的问题,前代这一比例为 94%;幻觉率从 88% 降至 33%,但 AA-Omniscience 准确率从 33% 降至 17%,近乎腰斩。

智能提升以更多输出 token 为代价

Agnes 2.5 Pro Beta 在每项智能指数任务上平均使用 5 万个输出 token,是 2.5 Pro Alpha(2.4 万)的两倍多,token 消耗高于 Qwen3.8 27B(xhigh,4.7 万)和 GLM-5.3(max,4.1 万)。在算力成本层面,这一变化值得关注。

模型规格与定价

  • 上下文窗口:100 万 token
  • 最大输出 token:6.5 万
  • 输入模态:文本、图像
  • 定价:输入 0.10 美元 / 输出 0.30 美元 / 缓存命中 0.01 美元(每百万 token)
  • 渠道:Agnes AI 官方 API

综合来看,Agnes 2.5 Pro Beta 是该实验室一次幅度可观的智能体方向升级,使其从「中游」向「准前沿」迈进,但推理效率与知识类准确率方面仍存在权衡。

信源