AI 频频翻车的七道智力题,你能做对几道?
文章梳理 AI 在空间推理、记忆与抽象推理类谜题上的失败案例,对比人类与模型表现,揭示当前大模型的认知短板。
「机器学习」一词由 IBM 科学家 Arthur Samuel 在 1959 年的一篇文章中推广,彼时他正在研究一种能自学下国际跳棋的算法。七十多年过去,棋类与逻辑谜题依然是衡量 AI 智能的重要试金石。从「纽约时报」Connections 字谜到 ARC-AGI 抽象推理基准,人类用谜题来测试模型,也借此审视大模型的能力边界。本文挑选了七道曾让 AI 栽跟头的题目,邀请读者亲自挑战。
总体趋势:进步飞快,但仍会犯低级错误
纯粹从解谜能力看,AI 近年进步迅猛。2024 年末,哥伦比亚大学团队的一项研究显示,即便是当时最强的模型,也只能解出 NYT Connections 谜题的 18%;到 2025 年初,部分模型已能在该测试上几乎全对。然而进步并不等于全面,模型在细节稍作改动后的经典谜题上仍频繁翻车,视觉类谜题更是长期短板。
空间推理:人类的强项,模型的软肋
人类在空间推理上拥有巨大优势,典型题型是「心理旋转」:判断同一物体从不同角度观察的形状。尽管现代语言模型已具备视觉输入分析能力,在这类任务上仍然表现糟糕。即使「世界模型」被广泛讨论,LLM 仍难以像建筑师或机械工程师那样自如地操纵三维对象。
记忆与适应性:训练数据可能成为陷阱
前沿 LLM 拥有庞大的事实记忆量,这是它们在 trivia 类问答中胜过人类的原因,但也可能成为弱点。当谜题与训练数据中见过的题目高度相似时,模型容易忽略关键差异,直接输出「背下来的」答案。
2024 年,谷歌与伊利诺伊大学厄巴纳-香槟分校的研究者训练并测试了模型在「骑士与无赖」逻辑谜题上的表现。这类题目要求根据每个人的发言判断谁永远说真话、谁永远说谎。当题目形式稍作改动,模型便会出错。SimpleBench 也呈现类似规律:题目看似简单、却暗藏陷阱,人类一眼识破,但即便是顶级模型也会被绊倒。
抽象与视觉推理:ARC-AGI 上的拉锯
AI 不仅在三维视觉题上失手,二维抽象推理同样挑战重重。最具代表性的基准是 ARC-AGI:题目给出若干示例网格,要求从中归纳抽象规则并应用到新输入。研究表明,模型即便在该基准上答对,其背后的推理路径往往复杂且缺乏泛化能力;人类则倾向于使用简洁的视觉概念。即使如此,过去一年模型在 ARC-AGI 上的整体成绩已有大幅提升,但仍有部分题目让其望而却步。
结语
这些谜题不仅是趣味游戏,更是一扇窗口。它们揭示出机器认知与人类认知之间的本质差异:模型在海量语料中提取模式,却难以像人类那样灵活旋转、推理与抽象。读者若能全部答对,至少在当下,证明了自己在这几道题上比 AI 更「聪明」。
