桃子桃子快讯
返回首页
行业动态

ARC-AGI-3 评测规则说明:Chollet 澄清测试工具边界

ARC-AGI 作者 Chollet 在 X 上发文,明确 ARC-AGI-3 评测中 harness 的合规与禁用情形…

2026.07.30 · 周四2 分钟阅读

ARC-AGI 系列基准的作者 François Chollet 近日在 X 平台发文,重申了在 ARC-AGI-3 评测中使用 harness(测试脚手架)的合规边界,并透露与 OpenAI 围绕测试方式的沟通已取得阶段性进展。

Harness 的合规与禁用边界

Chollet 把参赛方可能使用的 harness 分为两类,并给出明确判断:

  • 不可接受:专为破解 ARC-AGI-3 而定制、或内置了与基准格式、内容相关知识的 harness。
  • 可以接受:并非为 ARC-AGI-3 专门开发、且对所有 API 用户开放的通用 API 配置。

这意味着,模型提供方可以使用标准的 API 参数与提示策略,但不得借助任何针对 ARC-AGI-3 的「特供」接口、内部知识或定制化工具来提升成绩,否则将被视为破坏评测公平性。

与 OpenAI 的沟通进展

Chollet 表示,过去他与 OpenAI 就如何更好地测试其模型进行过多轮讨论,重点议题之一是「压缩」(compaction)相关设置——即在长上下文任务中对历史信息进行精简或摘要的处理方式。他对 OpenAI 正在厘清相关做法表示欣慰,但没有披露具体细节。

公平性靠透明来保障

Chollet 同时指出,如果不同厂商在被测时各自采用不同的 harness 设置,就会产生潜在的「对等性」问题——成绩高低可能并非来自模型本身,而是来自脚手架差异。他的立场是:只要各方的设置和调用成本被清晰披露,这种差异就是可以接受的。

这一表态也暗示,未来 ARC-AGI-3 公开榜单大概率会附带更详细的测试条件说明,包括 prompt、采样参数、压缩策略与 API 调用开销等,以减少因脚手架差异引发的成绩争议。对于关注前沿模型推理能力的研究者和从业者而言,这份「测试说明书」本身也将成为阅读榜单成绩时不可忽视的上下文。

信源