Mollick 称弱通用 AI 已达成?四项基准清单引热议
沃顿教授 Ethan Mollick 在 X 发文称,按 2020 年设定的弱通用 AI 标准,多项基准已提前一年被陆续…
宾夕法尼亚大学沃顿商学院教授 Ethan Mollick 近日在 X 平台发文称,按 2020 年学界与产业界讨论中提出的「弱通用 AI」判定标准,相关基准实际上已在一系列最新大模型上被陆续攻克,比此前多数预测提前了约一年。这一表态在社交媒体上迅速传播,也再度将「通用 AI 是否已悄然到来」的争论推上风口。
Mollick 列出的四项关键基准
Mollick 在帖子中以打勾清单的形式,逐一对照了 2020 年设定的一组弱通用 AI 测试条件:
- Loebner 奖(弱版图灵测试):被 GPT-4.5 达到同等水平。Loebner 奖曾被视为传统图灵测试的近似版本,以对话能否骗过人类评判为衡量标准。
- Winograd 模式挑战赛:由 GPT-3 通过。Winograd schema 常被用于测试模型对常识与指代消解的理解能力。
- SAT 考试:GPT-4 取得 75% 的成绩。SAT 是美国大学入学标准化考试,长期被视作通用知识与推理能力的参照。
- Montezuma's Revenge:Mollick 帖文中标注由「GPT-6」攻克。Montezuma's Revenge 是 Atari 2600 平台上一款以高难度著称的探险类游戏,长期被强化学习研究视为探索能力的试金石。
需要指出的是,帖文提及的「GPT-6」在公开信息中尚无系统性披露,Mollick 也未给出具体的模型版本或论文出处,该条目存在较大不确定性,读者在引用时应加以甄别。
「弱通用 AI」标准的来源与争议
「弱通用 AI」(Weakly General AI)并非学界统一定义,常见于 2020 年前后一系列对未来 AI 能力路径的预测报告与博客讨论中。其核心思想是:在一组覆盖语言、推理、知识、规划等维度的基准上达到人类水平或相当水平,即可视为跨过了弱通用门槛。
Mollick 的论证属于「达标清单式」判断——只要若干代表性基准被攻破,即可宣布该里程碑完成。这种方式的优势在于直观、可验证,但局限同样明显:
- 基准本身存在过拟合风险,模型针对特定测试集优化未必代表真实泛化能力;
- 所选基准并不能覆盖全部认知能力维度;
- 「达标」的具体阈值(如 75% 的 SAT 分数)在不同评测语境下含义并不一致。
讨论的更大意义
抛开具体基准是否充分、「GPT-6」信息是否准确不谈,Mollick 的帖子触及了一个核心问题:当大模型在越来越多的标准化测试上追平甚至超越人类时,社会与产业对「通用 AI」的界定标准是否需要重新审视。与其等待某一天宣布「AGI 时刻」降临,不如持续跟踪能力曲线在不同维度上的真实进展。
正如 Mollick 在近期多篇文章中所强调的:企业决策者更应关注 AI 在具体任务上的可用性变化,而非抽象的 AGI 时间表。在这一意义上,弱通用 AI 是否「已达成」的争论,其价值更多在于提醒从业者重新评估自身的工作流与产品假设——无论最终的学术定义如何,能力曲线本身已经在多个维度悄然越过了若干关键节点。
