桃子桃子快讯
←返回首页
研究论文

15 数码游戏实验:AI 会解难题却败给最简单的棋局

研究者用百万条解法训练 GPT 解 15 数码游戏,随机棋盘正确率达 99.9%,但面对只差一步或已解出的棋局却频繁翻车…

2026.09.27 · 周日约 3 分钟阅读

近期一篇发布于 Hacker News 的科普性研究文章,用经典的「15 数码游戏」作为实验载体,生动演示了大语言模型一种反直觉的能力现象:模型在复杂的随机棋盘上表现出色,却在最简单的棋局前频频翻车。研究人员将这种现象称为「锯齿状智能」(jagged intelligence),意指 AI 能力曲线并非平滑上升,而是呈现出参差不齐的边界。

实验设计:用「人造语言」训练 GPT

作者并未直接让模型去「理解」游戏规则,而是构造了一套只有 17 个符号的极简「语言」:用 16 个 token 表示初始棋盘,再用一个 token 表示空格,每个 token 对应一次合法移动,相当于用一句话记录完整解法。

随后,研究者随机生成 100 万个 15 数码游戏的起始状态,由一个「教师算法」逐步求解,并将每一步移动写成训练句子。文章提到,15 数码游戏共有约 10 万亿(即 16! / 2)种合法排列,100 万条训练样本仅占其中的 0.00001%,因此几乎不可能依赖记忆完成测试。

训练对象是一个与 ChatGPT 同架构的 GPT 模型,但它完全不接触任何人类语言,只学习这套人造「解法语言」。训练完成后,在 3000 个训练时未出现过的随机棋盘上,模型走出与教师算法完全一致的步数的比例达到 99.9%(2996 / 3000);剩余 4 局中,2 局中途出错,2 局走了不同但同样合法的解法。

反转:最难的反而不怕,最简单的反而不会

实验的关键转折出现在「极简单」的测试用例上:

  • 一步即可解出的棋局:六岁小孩都能完成,但训练后的 GPT 走了几步后尝试移动不可滑动的方块,直接判负。
  • 已经排好 1–15 的棋局:模型理应直接输出「终止」即可,却依然执行若干无效移动后输掉比赛。

作者指出,这种「复杂任务表现优异、简单任务意外失败」的反差,正是「锯齿状智能」一词的由来——AI 的能力图谱并非连续上升,而是存在明显的凹凸与断裂带。

这说明了什么

文章并未宣称发现新机制,而是借助一个直观、可亲手复现的小游戏,把当前大模型在分布外泛化、规则理解与「何时停止」等环节的脆弱性展示出来。它的价值更多在于:

  • 用 100 万条样本、3000 次测试给出了可量化的能力边界(99.9% vs. 0% 的极端对比);
  • 为「AI 能否真正理解规则」这一长期争论提供了一个新的可讨论样本;
  • 提醒开发者在评估 LLM 时,不能只看高难度基准上的亮眼分数,也要关注最基础的对抗性测试。

对研究者而言,这类实验提示我们:语言模型的「理解」可能更多是对训练分布的统计拟合,而非对底层规则的结构化掌握;而对使用者来说,文章再次强调了一个朴素经验——不要被模型在复杂任务上的高分迷惑,最简单的输入恰恰是检验可靠性的试金石。

信源