桃子桃子快讯
返回首页
研究论文

我们真的在正确评估 AI 智能吗?

Santa Fe Institute 的 Melanie Mitchell 提出,应借鉴发展心理学与比较心理学方法评估大…

2026.08.21 · 周五3 分钟阅读

当一个大模型给出一个看似经过深思熟虑的答案时,它究竟是在「推理」,还是在生成看起来像推理的文字?这个区分并非纯哲学问题——它直接决定了我们能放心地把哪些任务交给 AI、需要多大程度的人为监督,以及这项技术最终会产生怎样的现实影响。

访谈背景

Quanta Magazine 旗下播客《The Joy of Why》近期邀请到圣塔菲研究所(Santa Fe Institute)的认知科学家、计算机科学家 Melanie Mitchell,与主持人 Steven Strogatz 围绕「如何衡量机器认知」展开对话。Mitchell 长期关注 AI 与人类心智的交叉议题,本次已是她第二次做客该节目,时间恰逢大模型浪潮席卷全球近四年之际。

节目开篇,Mitchell 坦言,过去几年 AI 的演进速度令她始料未及——仅凭海量人类语料与图像训练,模型便涌现出当前的能力,这在她看来几乎是不可想象的。她同时注意到,围绕 AI 已形成显著的舆论分化:既有「AI 超越人类」的乐观派,也有「距离人类智能仍很远」的怀疑派,而这两类立场又与人们对 AI 的喜恶态度相互交织。

把 AI 视作「异类智能」

Mitchell 主张,应当把 AI 视作一种「异类智能(alien intelligence)」:其认知机制与人类不同,因此套用人类智能的衡量方式并不总是合适。她指出,研究者可以从两个已有的「异类智能」研究传统中借力:

  • 发展心理学:观察婴幼儿如何逐步获得推理、概念和语言能力。
  • 比较心理学:研究鸟类、犬类、海豚等动物在不同环境下的认知表现。

两者的共同点在于,科学家必须借助行为实验与可观测输出,而非直接拆解大脑或神经系统。Mitchell 认为,这套思路同样适用于当下难以完全解释内部机理的大模型。

评估机器认知的六条原则

访谈中,Mitchell 提出了六条用于「更好评估机器认知」的原则(具体细节以节目正片为准)。她强调,良好的评测体系应当:

  • 避免单一基准的过度简化;
  • 在受控条件下设置「反例」与对照实验;
  • 关注模型在分布外情境下的稳健性;
  • 区分「能力」与「表现」,警惕表面能力背后的捷径;
  • 把对内部机制的可解释性研究与行为评估结合;
  • 借鉴对婴幼儿与动物认知的实验范式进行类比设计。

她特别提醒「聪明的汉斯(Clever Hans)」式的警示:上世纪初那匹看似会做算术的马,其实只是在读取训练员的无意识微表情。类似地,今天的大模型也可能在测评中捕捉到统计规律或提示词中的隐性信号,而非真正具备被测能力。

对数学突破与未来评测的启示

节目还谈到近期 AI 辅助下的若干数学进展。Mitchell 认为,这些案例一方面展示了模型在特定形式化任务上的潜力,另一方面也再次凸显了「能力评估」的难度:当 AI 与人类专家协作得出新结果时,我们仍需谨慎区分其中哪些步骤是模型真正「理解」的,哪些只是模式匹配的副产品。

她呼吁,学术界和工业界应共同投入更严谨的认知评测方法,让外界——包括政策制定者、企业用户和普通公众——能够更准确地理解大模型「能做什么、不能做什么」,从而为部署边界与监管节奏提供更可靠的依据。

信源