OpenAI 发布 GPT-6 Astra,主打计算机操作与交互式推理
OpenAI 推出 GPT-6 Astra,号称在计算机使用、浏览、软件工程等多项基准刷新纪录;Chollet 评测 A…
OpenAI 近日正式推出新一代旗舰模型 GPT-6 Astra,并将其定位为「全球最智能、最对齐」的模型。OpenAI 官方表示,Astra 在计算机使用、浏览器操作、软件工程、网络安全、科学研究以及通用专业工作等多个维度刷新了业界最优水平(state of the art)。作为面向通用智能体的基础模型,Astra 被描述为「能在计算机上完成的任何任务,都能快速代为执行」。
核心定位:通用计算机操作智能体
根据 OpenAI 官方账号及联合创始人 Greg Brockman 在 X 平台发布的介绍,GPT-6 Astra 的核心卖点是面向「计算机使用」场景的端到端能力。Astra 不再局限于问答或文本生成,而是试图接管完整的桌面/浏览器操作链路,覆盖从信息检索、软件工程任务到安全攻防在内的多种高阶任务。该模型被视为 OpenAI 在通用 Agent 方向上的又一次重要迭代。
ARC-AGI-3 基准表现
著名 AI 研究者 François Chollet(Keras 作者、ARC-AGI 基准发起人)随后在 X 上发布了基于 Astra 的独立评测结果:
- 在 ARC-AGI-3 标准评测框架下,Astra 的得分为 66%。
- 切换至「连续对话框架(continuous conversation harness)」并结合自定义上下文压缩(compaction)后,得分接近 100%。
- 该连续对话版本在绝大多数关卡上的「动作效率」甚至显著高于人类基线。
- 单局游戏的推理成本约为 360 美元。
Chollet 评价 Astra 代表着「交互式推理问题(interactive reasoning problems)模型能力的阶跃式提升(step-function change)」。
推理机制:自发形成符号化世界建模
Chollet 团队对 Astra 的推理链(reasoning chains)进行了分析,发现模型展现出三项值得注意的行为特征:
- 对每个游戏关卡实时进行高效的符号化世界建模(symbolic world modeling);
- 自发开发出用于描述游戏状态的「速记 DSL」,本质上是一种「游戏专属的代数记号」;
- 这种符号化建模能力在此前通常只有经过精心设计的外部框架(sophisticated harnesses)才能激发,意味着模型本身已具备相当的内在结构化推理能力。
成本与算力门槛
Chollet 指出,Astra 取得高分并非「免费午餐」:以 ARC-AGI-3 单局约 360 美元的计算开销计算,模型需要在多轮交互和大规模 token 消耗下持续运行,才能充分发挥其推理潜力。这表明 Astra 的能力高度依赖推理阶段的算力扩展,部署成本仍是落地应用需要重点权衡的因素。
