AI 解决数学难题并非更聪明,而是「更不健忘」
分析文章指出,AI 在数学任务中的优势可能更多来自巨大的上下文窗口,而非真正的推理突破。
当 AI 系统解决一道困难的数学题时,人们通常认为它变得更聪明了。但一篇分析文章提出了另一种解释:AI 并不一定在推理能力上超越了数学家,而是拥有远比人类大脑更大的「工作记忆」,其数学优势本质上来自对人类认知瓶颈的绕开,而非真正的通用智能突破。
人类工作记忆的天然上限
人类工作记忆是用于短时保持和操控信息的心理系统,其容量极为有限。经典的「7±2」法则指出,人一次只能同时处理约 5—9 个不熟悉的元素。心算两位数与三位数相乘之所以困难,根本原因在于需要保留多个中间结果,而每多记一步就会进一步压缩可用空间。
数学家通过「组块化」(chunking)缓解这一限制:把一串符号识别为一个熟悉的整体结构,从而将更多信息压缩进有限的工作记忆。但这只是压缩,并未消除上限。
工作记忆独立预测数学能力
多项研究显示,工作记忆与数学能力之间存在独立于一般智力的关联:
- Alloway 与 Passolunghi(2011)对儿童的研究发现,工作记忆对数学表现有超出语言能力的独特贡献。
- Alloway 与 Alloway(2010)的六年纵向研究表明,5 岁时的工作记忆表现能预测 11 岁时的读写与算术成绩,且预测力强于所使用的 IQ 指标。
- Blankenship 等人(2015)报告,工作记忆在控制 IQ 与年龄后仍能解释数学流畅性的独特变异。
- Friso-van den Bos 等人(2013)的大规模元分析同样发现,工作记忆与数学在小学阶段存在一致关联。
核心结论是:在智力水平相近的儿童中,保留、更新和操控信息的能力差异,仍能预测数学表现的差异。
AI 的「巨型外部笔记本」
现代语言模型可以一次性处理数以万计的 token,其中包含原题、定义、示例、中间计算以及模型自身的推理过程。这一上下文窗口相当于一本巨大的外部笔记本,虽然其检索与利用机制仍不完美,但已远超人类大脑的短时记忆极限。
文章由此提出一个值得思考的命题:当 AI 在数学任务中击败人类时,它可能并非「更聪明」,而是突破了长期压制人类数学表现的那种生物性限制。这正契合 1952 年 IAS 计算机启用时对机器的期待:放大冯·诺依曼式的速度、广度与符号记忆,而非孕育电子爱因斯坦。
启示与边界
这一观点并非否认 AI 在推理策略上的进步,也不否定 RLHF 等训练方法的价值。它提示我们:在评估 AI 的数学能力时,应区分「真正的新推理能力」与「由更大工作空间带来的性能红利」。将后者误读为前者,可能高估当前 AI 系统的通用智能水平。
