桃子桃子快讯
返回首页
研究论文

OpenAI 透露 GPT-5.6 Sol 数学与 ARC-AGI-3 实测细节

OpenAI 称 GPT-5.6 Sol 已用于求解开放数学问题,但在 ARC-AGI-3 表现不佳;调查发现启用两个…

2026.07.30 · 周四2 分钟阅读

OpenAI 近日在官方 X 账号上发文,披露其新一代模型 GPT-5.6 Sol(代号 Sol)在数学与通用推理基准上的实际表现与一项令人意外的工程发现。该模型已被用于求解若干开放数学问题,但在 ARC-AGI-3 这一以二维谜题为形式的推理基准上却表现挣扎。OpenAI 研究团队随后展开调查,结果显示问题并非出在模型本身,而在于调用方式。

数学上的突破与 ARC-AGI-3 上的反差

OpenAI 在帖文中指出,GPT-5.6 Sol 已在数学领域取得实际应用进展,被用于尝试解决一些尚未被攻克的开放数学问题。然而在面对 ARC-AGI-3——以二维网格谜题著称、用于衡量模型抽象推理能力的基准时,模型的表现却远低于预期。这种「数学强、谜题弱」的反差促使团队进行了针对性排查。

关键发现:两个 API 设置改变结果

经过调查,OpenAI 表示,问题根源在于模型的「harness」(即调用与运行环境)未能让它有效记住此前学到的内容。在启用两个 API 设置后,团队在 ARC-AGI-3 上的得分提升至原来的约三倍,同时输出 token 数量减少了约六倍。换言之,模型能力本身并未改变,瓶颈在于上下文管理与记忆机制的调用方式。

对开发者的启示

OpenAI 的这一发现具有实践意义:即便是同一模型,调用参数的差异也可能导致基准表现出现数倍差距。这提示开发者在评估模型能力时,应同时关注推理配置与上下文策略,而非仅看原始模型版本。OpenAI 在帖文末尾以「we investigated」收尾,暗示后续可能发布更完整的技术说明。

当前信息边界

截至目前,OpenAI 仅在 X 平台以短文形式披露上述发现,尚未公布 GPT-5.6 Sol 的完整模型卡、参数规模、具体基准分数明细,也未指明是哪两个 API 设置起到了关键作用。读者如需进一步技术细节,仍需等待 OpenAI 后续的官方说明或配套发布。

信源