桃子桃子快讯
返回首页
行业动态

ARC-AGI-3 半年内被 AI 从 不足 1% 做到 100%,Chollet 回应基准争议

Chollet 表示,3 月发布时前沿模型得分不足 1% 的 ARC-AGI-3 基准,如今 AI 已可达到 100%,…

2026.09.04 · 周五2 分钟阅读

ARC-AGI 系列基准的创始人 François Chollet 近日在 X 平台发文,回应了今年 3 月 ARC-AGI-3 发布以来围绕该基准的争议。他同时披露了一个关键事实:在基准发布后的 6 个月内,AI 在 ARC-AGI-3 上的得分从不足 1% 上升到了可达到 100%,这一速度超出多数人的预期。

争议缘起:基准是否「有问题」

Chollet 回忆,ARC-AGI-3 在 3 月发布时,前沿大模型在该基准上的得分不足 1%。这一结果被部分自称「奇点论者」的网友视为冒犯,并引来大量批评。批评意见集中在以下几点:

  • 基准本身存在设计缺陷;
  • 即便是最聪明的人类也无法完成其中的任务;
  • 该基准的最高可达分实际上只有 40% 左右。

由于释放的是一个「未饱和」的基准,Chollet 与团队不得不在此后数月间应对大量侮辱性言论。

人类基线说明与 100% 的可达性

Chollet 在文中澄清了基准的标定逻辑。他指出,只要人类测试者的表现略高于「普通人」水平,就能在 ARC-AGI-3 上拿到 100% 的分数——这只需用比现有「人类基线」更少的动作数即可达成。他同时强调,ARC-AGI-3 的人类基线并不算强,因为测试者并未经过筛选。

换言之,基准设计本身并无问题,100% 并非不可触及的天花板,而是普通能力之上的正常表现。

半年跨越:AI 从 <1% 到 100%

Chollet 公布的最关键信息是:自 3 月发布以来,AI 在 ARC-AGI-3 上的得分已经从不足 1% 上升到可达到 100%。他写道:

「AI 从 <1% 到 100% 的轨迹表明,这一基准成功捕捉到了智能体能力的近期崛起。而这一崛起的速度,比大多数人预期的更快,包括我们自己。」

这一结果意味着,ARC-AGI-3 在半年内由「前沿模型几乎无法完成」变成了「可以被 AI 完整解决」,正好覆盖了智能体能力快速跃升的时间窗口。Chollet 此次的表态,既是对基准有效性的自我辩护,也是对当前智能体进展速度的一次正式确认。

信源