Nvidia 研究:在长程任务中,框架比模型更重要
Nvidia 借助自研框架让 Claude Opus 5 在 ARC-AGI-3 取得 100% 满分,凸显智能体系统中…
Nvidia 于本周五发布的一项研究指出,在长程任务(long-horizon tasks)中,决定 AI 智能体表现的关键并非底层模型,而是围绕模型的「框架」(harness)。研究人员通过自研框架配合「监督者」组件,让 Claude Opus 5 在交互式推理基准 ARC-AGI-3 上取得了 100% 的满分成绩。
核心观点:智能体不等于模型的 API
Nvidia AI 部门产品副总裁 Adel El Hallack 表示,业界习惯把智能体看作底层模型的「API」,但实际上智能体由三部分组成:模型本身、围绕模型的脚手架(即框架,含可调用的工具集),以及运行时及配套的技能与库。在长程任务场景下,框架负责管理记忆、上下文与反馈,其重要性远超多数用户的预期。
El Hallack 指出,长程任务需要把大量决策串联起来,有时甚至跨越数天才能完成,这正是当前 agentic 研究的重点难题之一。
基准测试结果:ARC-AGI-3 上的明显跃升
ARC-AGI-3 由一系列无说明的 2D 游戏构成,要求模型自主摸索玩法并取胜,对推理与规划能力要求极高。Nvidia 在测试中得到以下结果:
- 使用定制框架(含「监督者」组件)时:Claude Opus 5 取得 100% 满分
- 不使用框架时:Opus 5 得分 30%,已是所有受测模型中的最高分
El Hallack 强调,最关键的创新是在主智能体之外引入一个「监督智能体」,类似 CEO 的角色,会在主智能体偏离方向、走向死胡同或重复已探索路径时及时纠正。
行业呼应:多家厂商得出类似结论
Nvidia 的发现并非孤例。近期多家机构的研究也指向类似结论:
- OpenAI:其模型在 ARC-AGI-3 上得分不到 10%,上月自研发现仅调整框架两项设置,分数即可翻三倍,但仍远未达到 100%
- 微软:今年 4 月对 19 个大模型进行长程文档编辑测试,所有模型(包括前沿模型)均在文档中产生大量错误
- Databricks:今年 7 月发布的研究显示,框架选择对 AI 成本的影响可达 2 倍;CEO Ali Ghodsi 表示「同一模型搭配不同框架,成本差异巨大」
这些结果共同指向一个趋势:在 agentic 系统中,模型选择只是冰山一角,框架设计才是拉开差距的关键变量。
开源路线:Nemo 与 AVO 框架
Nvidia 并未把此次成果包装为新产品。相关组件以 Nemo 品牌陆续发布,其中部分商用、部分开源,涵盖研究人员自研的 Agentic Variation Operators(AVO)框架。El Hallack 表示,开放的智能体技术栈——覆盖框架、基础设施、运行时——才能让用户在安全可控的前提下推动生态向前发展。
