研究论文
Reddit 用户称 NVIDIA AVO 在 ARC-AGI-3 上拿下 100% 满分
r/LocalLLaMA 一则帖子称 NVIDIA AVO 完成 ARC-AGI-3 全部 183 关卡、25 个公开环…
2026.08.21 · 周五约 2 分钟阅读
r/LocalLLaMA 上一则由用户 /u/theologi 发布的帖子声称,NVIDIA 的 AVO 模型在 ARC-AGI-3 基准测试中取得 100% 成绩,完成全部 183 个关卡,覆盖 25 个公开环境,且全程「无指令、无显式规则、无目标说明」。如果该结果属实,将是 ARC 系列基准测试历史上罕见的满分表现之一。
帖子披露的核心信息
根据帖标题所给信息,可以梳理出以下几个要点:
- 模型名称为 NVIDIA AVO,目前公开资料中关于该模型的细节较为有限。
- 任务为 ARC-AGI-3,由 François Chollet 团队维护的抽象推理基准系列。
- 成绩:100%,覆盖 183 关、25 个公开环境。
- 行为特征:模型在没有任何指令、显式规则或目标陈述的情况下,自主推断出任务内容并完成求解。
可信度与信息缺口
需要指出的是,原帖为典型的 Reddit 链接贴(link post),正文区域除标题外几乎无实质内容,未附带论文链接、官方博客、基准提交页面或详细得分截图。因此,下列关键信息在本则资讯中均无法核实:
- AVO 模型的参数量、架构、训练方法与发布时间;
- ARC-AGI-3 的官方公开版本是否已上线,以及 NVIDIA 是否为正式提交方;
- 100% 成绩是否经过独立复现或官方确认。
由于缺乏一手来源支撑,此事暂以社区爆料形式呈现,读者宜关注后续 NVIDIA 官方渠道或 ARC Prize 官方榜单的确认信息。
ARC-AGI 基准的背景
ARC-AGI 系列自 2019 年由 François Chollet 提出以来,一直被视为衡量「通用抽象推理能力」的重要参考。此前各参赛系统在 ARC-AGI-1 与 ARC-AGI-2 上的得分通常远低于 100%,即便是专门针对该基准优化的方案,也多以部分关卡通过率作为衡量指标。因此,若 NVIDIA AVO 的成绩最终被官方认可,将对通用智能评测领域产生显著影响。
