行业动态
知名学者批评 AI 基准测试现状:饱和与失准并存
沃顿教授 Mollick 发文称公开 AI 基准测试饱和与失准并存,正削弱行业对模型能力的准确判断。
2026.09.16 · 周三约 2 分钟阅读
沃顿商学院教授、知名 AI 公共评论人 Ethan Mollick 近日在 X(原 Twitter)上发文,公开批评当前公开 AI 基准测试(benchmark)生态的现状,认为其正处于令人担忧的状态,并正在削弱人们对 AI 模型真实能力的判断。
两大核心问题
Mollick 在推文中指出,当前公开 AI 基准测试面临两个层面的困境:
- 饱和问题:最广为人知的那些测试基准已经「触顶」,主流大模型在多数指标上已接近或达到满分,这些基准因此失去了区分与衡量能力差异的作用。
- 可靠性问题:尚未饱和的测试基准则存在大量错误,导致 AI 能力被严重低估。他在推文中引用了一篇论文来佐证这一判断,但受推文篇幅限制,未展开论文的方法与数据细节。
行业影响
Mollick 的表态触及了一个长期被忽视的结构性问题:开发者、研究者以及公众越来越难借助公开基准判断「哪个模型更强」。当头部基准丧失区分度,二线基准又因误差而失真,整个评测生态的可信度都会受到连带损害。换言之,benchmark 排行本身可能正在失去其参考价值。
为何值得关注
Mollick 是近年来在 AI 应用与产业层面颇具影响力的公共评论者之一,长期在 Substack 专栏「One Useful Thing」发表分析。此次发声虽为短评,却指出了 AI 行业基础设施层面的痛点——评测体系是否健康,直接关系到模型迭代方向、投资决策以及公众对 AI 进展的认知是否准确。从业者在转发讨论中也普遍认同,AI 行业亟需建立更可靠、更有区分度、更能抵抗「饱和」的新一代评测体系。
需要说明的是,由于本次信息来源为社交平台短帖,所引论文的具体方法、数据与结论尚未在推文中披露,若需进一步判断该批评的适用范围,仍有待原始论文与更详尽的行业分析作为支撑。
