行业动态
ARC-AGI-3 评测规则说明:Chollet 澄清测试工具边界
ARC-AGI 作者 Chollet 在 X 上发文,明确 ARC-AGI-3 评测中 harness 的合规与禁用情形…
2026.07.30 · 周四约 2 分钟阅读
ARC-AGI 系列基准的作者 François Chollet 近日在 X 平台发文,重申了在 ARC-AGI-3 评测中使用 harness(测试脚手架)的合规边界,并透露与 OpenAI 围绕测试方式的沟通已取得阶段性进展。
Harness 的合规与禁用边界
Chollet 把参赛方可能使用的 harness 分为两类,并给出明确判断:
- 不可接受:专为破解 ARC-AGI-3 而定制、或内置了与基准格式、内容相关知识的 harness。
- 可以接受:并非为 ARC-AGI-3 专门开发、且对所有 API 用户开放的通用 API 配置。
这意味着,模型提供方可以使用标准的 API 参数与提示策略,但不得借助任何针对 ARC-AGI-3 的「特供」接口、内部知识或定制化工具来提升成绩,否则将被视为破坏评测公平性。
与 OpenAI 的沟通进展
Chollet 表示,过去他与 OpenAI 就如何更好地测试其模型进行过多轮讨论,重点议题之一是「压缩」(compaction)相关设置——即在长上下文任务中对历史信息进行精简或摘要的处理方式。他对 OpenAI 正在厘清相关做法表示欣慰,但没有披露具体细节。
公平性靠透明来保障
Chollet 同时指出,如果不同厂商在被测时各自采用不同的 harness 设置,就会产生潜在的「对等性」问题——成绩高低可能并非来自模型本身,而是来自脚手架差异。他的立场是:只要各方的设置和调用成本被清晰披露,这种差异就是可以接受的。
这一表态也暗示,未来 ARC-AGI-3 公开榜单大概率会附带更详细的测试条件说明,包括 prompt、采样参数、压缩策略与 API 调用开销等,以减少因脚手架差异引发的成绩争议。对于关注前沿模型推理能力的研究者和从业者而言,这份「测试说明书」本身也将成为阅读榜单成绩时不可忽视的上下文。
