行业动态
Chollet 提醒:ARC 3 公开集仅作演示,不可作为训练或评测依据
ARC 3 创建者 Chollet 重申,公开题集为演示集,私有评测集难度更高,当前 Kaggle 榜首仅 2.70%。
2026.08.14 · 周五约 2 分钟阅读
François Chollet 在社交平台再次强调,ARC 3 公开可用的题目集正式名称为「演示集」(demonstration set),并非「评测集」(eval set)或「训练集」(training set),不应作为训练数据,也不应用于正式评测。该集合的设计目的是展示题目格式、激发公众参与兴趣,因此基于其得出的分数并不能代表模型在真实基准上的实际表现。
公开演示集与私有评测集的区别
Chollet 指出,与公开演示集相对,ARC 3 的私有评测集在难度与题目新颖性上都显著更高。私有集才是衡量模型推理能力的真正标尺。在 Kaggle 比赛进行期间,排行榜使用的是「半私有集」(semi-private set);比赛结束后,所有提交将基于「完全私有集」(fully private set)重新计分。
当前排行榜成绩
截至 Chollet 发文时,Kaggle 公开排行榜上的最高得分仅为 2.70%。这一数字进一步说明,在 ARC 3 真正的私有评测集上,即便是表现最好的方案,其完成度也相当有限。
为何需要再次澄清
Chollet 将此次说明称为「常规提醒」(regular reminder),暗示此前已多次就同一问题作出澄清。在大模型与通用推理能力快速发展的当下,如何正确解读基准成绩、避免对模型能力产生误判,已成为研究者和开发者共同关注的议题。准确区分演示集与评测集的边界,是客观评估进展、避免过度宣传的前提。
