桃子桃子快讯
返回首页
行业动态

前沿 AI 基准测试正失去人类基线对比

Molnick 指出,AI 基准测试日益复杂,建立人类基线对比越来越难、成本高昂,但这一环节仍至关重要。

2026.07.30 · 周四2 分钟阅读

随着用于测试前沿 AI 模型的基准测试(benchmark)日趋复杂,一个曾被视为基准测试「标配」的要素正在被弱化——人类基线对比。沃顿商学院教授、AI 领域知名评论者 Ethan Molnick 近日在 X 上发文指出了这一现象。

为什么基准测试需要人类基线

在 AI 模型能力评估体系中,一个「经过验证的基准」(validated benchmark)通常需要包含人类(理想情况下是多位人类)的表现作为参照基线。其意义在于:只有知道人类在同一任务上的水平,才能判断模型表现究竟意味着什么——是已超越人类,还是仍存在明显差距。

  • 没有人类基线的 benchmark,只能给出模型自身的分数,无法回答「这在现实世界中意味着什么」的问题。
  • 当 benchmark 题目越来越复杂时,寻找足够多合格的人类参与者来完成测试并保证结果可靠,成本和难度都在上升。

现实困境:成本与复杂度的拉锯

Molnick 在推文中强调,建立并维护人类基线「越来越难、成本越来越高,但仍然重要」。这折射出当前 AI 评估领域的一个结构性矛盾:

  • 一方面,模型能力快速迭代,需要更复杂、更接近真实场景的测试题目;
  • 另一方面,复杂题目意味着只有领域专家才能可靠作答,普通众包平台难以胜任,招募与验证成本急剧上升。

对行业评估的启示

如果人类基线持续缺失,业界对于「AI 超越人类」或「AI 仍落后于人类」等关键判断将失去可靠的对照系。这不仅影响学术论文中的能力声明,也会波及产品宣传、投资决策乃至公共讨论中关于 AI 进展的叙事。

Molnick 的提醒虽然只是一段推文,却指向 AI 评估方法论中一个长期被低估的环节——在追求更复杂测试的同时,如何保住「人」这一最基本的参照系,仍是行业需要正视的难题。

信源