桃子桃子快讯
返回首页
行业动态

METR 长时任务基准或已饱和?Mollick 发文引发讨论

Ethan Mollick 发文指出,METR 长时任务评估图自五月以来未更新,或已饱和。

2026.09.08 · 周二2 分钟阅读

Ethan Mollick 近日在 X 上发文,质疑知名 AI 能力评估组织 METR 的「长时任务」(long horizons)衡量指标是否已经事实上饱和。他指出,那张广为引用的 AI 进步曲线图自五月以来便再未更新,但同期其他已发表的研究表明,配合适当的脚手架(harness),现有模型已可完成 18 周以上的连续自主任务量。Mollick 特别提到「Fable」,并推测下一代 GPT(即 GPT-6)很可能也已达到类似水平。

关于 METR 长时任务基准

METR(Model Evaluation and Threat Research)是专注于前沿模型能力与潜在风险评估的研究机构,其「长时任务」指标衡量的是 AI 智能体在无人干预下持续完成真实软件工程任务的时间长度,是评估 AI 自主性与可靠性最常被引用的参考之一。该指标的曲线图长期以来被视为追踪 AI 自主能力跃迁的「标志性图表」。

「饱和」意味着什么

Mollick 所说的「饱和」并非指模型不再进步,而是指当前公开的评估任务难度可能已不足以拉开不同代际模型之间的差距——也就是说,模型的真实能力已经超出该基准所能区分的区间。要想继续观测进步曲线,研究者需要构造更具挑战性、更长链路的新任务。

仍待验证

需要指出的是,Mollick 的上述判断基于其个人观察与零散的二次资料,其中「Fable」的指代对象以及 18 周任务量的具体来源在原帖中并未给出更多细节,相关结论仍属业内人士的推测性讨论,尚未得到 METR 或相关模型厂商的正式回应。

信源