行业动态
同一 AI 模型两套测试框架分数差超 10 个百分点
TestingCatalog 指出 GPT-5.6 Luna 在同一 107 题上跑出 33.6% 与 44.9%,差距…
2026.08.29 · 周六约 2 分钟阅读
TestingCatalog 在 X 平台发文指出,AI 模型在基准测试中的表现高度依赖其所运行的测试框架(harness)。以一款名为 GPT-5.6 Luna 的模型为例,该模型在同一组 107 道任务上,分别跑出 33.6% 和 44.9% 的成绩,分数差距高达 11 个百分点。
框架带来的波动大于名次差距
更值得关注的是,这一由测试框架差异导致的分数波动幅度,甚至超过了该榜单上第二名到第八名之间的真实名次间隔。也就是说,在某些评测场景下,「怎么跑」对结果的影响不亚于「跑的是什么模型」。TestingCatalog 认为,这一现象提示从业者在解读各类 AI 榜单排名时,需要将测试框架本身纳入考量。
脚手架与模型能力同等重要
这一规律在长周期商业任务(long-horizon commerce tasks)中尤为突出。TestingCatalog 表示,围绕模型搭建的脚手架(scaffolding)——包括提示工程、工具调用链路、多步规划等——能够将最终分数推动到与模型自身能力相当的幅度。换言之,仅凭单一框架下的跑分,已难以准确刻画一个模型的实际水平。
人类仍是关键决策者
文章同时指出,即便 Agent 能力持续提升,在长链路商业场景中,关键决策仍由人类完成,Agent 更多承担执行环节的任务。这意味着在评估 Agent 系统时,不应只看底层模型的基准分数,还需综合衡量人机协作链路在真实任务中的整体效率。
