桃子桃子快讯
返回首页
产品功能

OpenAI Astra 在三项智能体基准上刷新最优成绩

OpenAI 宣布 Astra 在 Agents' Last Exam、AutomationBench、ScreenSp…

2026.09.04 · 周五2 分钟阅读

OpenAI 近日通过官方 X 账号宣布,其智能体系统 Astra 在三项面向跨职业计算机工作流任务的基准测试中取得当前最优结果(SOTA),分别为 Agents' Last Exam、AutomationBench 和 ScreenSpot Pro。这是 OpenAI 首次以「Astra」之名公开披露相关性能数据,但官方未在原帖中给出具体分数、对比基线或模型规格,更详细的内容指向帖子附带的外部链接。

三个基准分别测什么

  • Agents' Last Exam:面向智能体的高难度综合评测,覆盖多领域、多步骤的复杂任务执行,考验模型在真实工作流中的推理与决策水平。
  • AutomationBench:聚焦自动化场景,评估智能体在桌面与软件环境中完成端到端操作任务的能力。
  • ScreenSpot Pro:以屏幕内容理解为核心,衡量智能体对图形界面元素的定位、识别与交互能力。

三项基准共同指向「跨职业的计算机工作流」,意味着 Astra 宣称在通用办公与软件操作类任务上具备领先表现。

「Astra」是什么

从公开口径看,Astra 是 OpenAI 体系下用于完成「computer use」类任务的智能体产品或模型版本。它与近期 OpenAI 在 ChatGPT 中上线的 Agent 模式同属代理式 AI 方向,但本次帖子并未明确说明 Astra 是 ChatGPT Agent 的内部代号、独立的 API 模型,还是面向开发者的新接口。

意义与待补充信息

如果成绩属实,Astra 意味着 OpenAI 在「会用电脑的 AI」这一赛道继续领跑。但目前缺少三组关键数据:各基准的具体得分、与上一代基线(如基于 GPT-4o 的代理)的提升幅度,以及第三方独立复现的可能性。OpenAI 在帖子中附带了外部链接,详细的论文或技术报告可能随后发布。

对于关注代理式 AI 的开发者和企业用户而言,三项基准同时登顶是一个值得跟踪的信号;但在官方释放完整技术细节之前,Astra 的实际能力边界仍有待验证。

信源