桃子桃子快讯
返回首页
研究论文

Nvidia 研究:在长程任务中,框架比模型更重要

Nvidia 借助自研框架让 Claude Opus 5 在 ARC-AGI-3 取得 100% 满分,凸显智能体系统中…

2026.08.22 · 周六3 分钟阅读

Nvidia 于本周五发布的一项研究指出,在长程任务(long-horizon tasks)中,决定 AI 智能体表现的关键并非底层模型,而是围绕模型的「框架」(harness)。研究人员通过自研框架配合「监督者」组件,让 Claude Opus 5 在交互式推理基准 ARC-AGI-3 上取得了 100% 的满分成绩。

核心观点:智能体不等于模型的 API

Nvidia AI 部门产品副总裁 Adel El Hallack 表示,业界习惯把智能体看作底层模型的「API」,但实际上智能体由三部分组成:模型本身、围绕模型的脚手架(即框架,含可调用的工具集),以及运行时及配套的技能与库。在长程任务场景下,框架负责管理记忆、上下文与反馈,其重要性远超多数用户的预期。

El Hallack 指出,长程任务需要把大量决策串联起来,有时甚至跨越数天才能完成,这正是当前 agentic 研究的重点难题之一。

基准测试结果:ARC-AGI-3 上的明显跃升

ARC-AGI-3 由一系列无说明的 2D 游戏构成,要求模型自主摸索玩法并取胜,对推理与规划能力要求极高。Nvidia 在测试中得到以下结果:

  • 使用定制框架(含「监督者」组件)时:Claude Opus 5 取得 100% 满分
  • 不使用框架时:Opus 5 得分 30%,已是所有受测模型中的最高分

El Hallack 强调,最关键的创新是在主智能体之外引入一个「监督智能体」,类似 CEO 的角色,会在主智能体偏离方向、走向死胡同或重复已探索路径时及时纠正。

行业呼应:多家厂商得出类似结论

Nvidia 的发现并非孤例。近期多家机构的研究也指向类似结论:

  • OpenAI:其模型在 ARC-AGI-3 上得分不到 10%,上月自研发现仅调整框架两项设置,分数即可翻三倍,但仍远未达到 100%
  • 微软:今年 4 月对 19 个大模型进行长程文档编辑测试,所有模型(包括前沿模型)均在文档中产生大量错误
  • Databricks:今年 7 月发布的研究显示,框架选择对 AI 成本的影响可达 2 倍;CEO Ali Ghodsi 表示「同一模型搭配不同框架,成本差异巨大」

这些结果共同指向一个趋势:在 agentic 系统中,模型选择只是冰山一角,框架设计才是拉开差距的关键变量。

开源路线:Nemo 与 AVO 框架

Nvidia 并未把此次成果包装为新产品。相关组件以 Nemo 品牌陆续发布,其中部分商用、部分开源,涵盖研究人员自研的 Agentic Variation Operators(AVO)框架。El Hallack 表示,开放的智能体技术栈——覆盖框架、基础设施、运行时——才能让用户在安全可控的前提下推动生态向前发展。

信源