桃子桃子快讯
返回首页
研究论文

谷歌测了 450 万次:GPT-5 答不出答案,问题不在存不住而在取不出

谷歌发现 GPT-5、Gemini 3 等前沿模型的事实错误主要由「回忆失败」而非「存入失败」造成,thinking 模…

2026.08.14 · 周五5 分钟阅读

Google Research 团队在即将召开的 ICML 2026 上发表论文《Empty Shelves or Lost Keys?》,并于 8 月 12 日发布配套博客与开源基准 WikiProfile。研究团队对 GPT-5、GPT-4.1、Gemini 3、Gemma 3 四个家族的 13 个模型进行了系统测试,累计采样约 450 万次回答,最终得出一个反常识的结论:前沿大模型的事实错误,大头已经不是「没学过」,而是「学过了却取不出来」。

核心发现:货上架了,钥匙丢了

研究团队设计了一套「知识画像」(Knowledge Profile)框架,把模型对一条事实的处理状态划分为五种:存入失败、回忆失败、直接回忆、借助 thinking 回忆、未存入却靠推理答对。

  • 存入判断:把维基原文截到答案出现之前,让模型续写;或在同等上下文后直接发问。两道题都关闭 thinking,把「记住了」和「推出来的」分开。
  • 直接回答:换措辞、换正反方向反复提问。

测试结果呈现出清晰的两层落差:

  • 存入层面:13 个模型把 95%–98% 的测试事实写进了参数;
  • 直接回忆层面:只剩 66%–74% 能直接取出;
  • 开启 thinking 后:仍剩 11%–12% 怎么也想不起来。

两个最堵的地方:冷门知识与反向提问

研究识别出「取不出来」最严重的两个场景。

一是冷门知识。以 Gemini-3-Pro 为例,后 20% 的冷门事实存入率达 94.5%,前 20% 热门事实为 99.5%,差距仅约 5 个百分点;但直接回忆时,冷门事实跌至 63.3%,热门事实为 84.7%,差距被拉大到约 21 个百分点。GPT-5 的落差更显著:冷门事实存入率 90.7%,直接回忆率仅 52.9%;热门事实两项分别为 98.4% 和 77.8%。

二是反向提问。GPT-5 正向问答回忆率 82.9%,反向降至 74%。但同一批题改成四选一选择题后,13 个模型中有 9 个的反向表现反而优于或持平于正向。研究团队据此判断,事实的双向关联在参数中确实存在,真正卡住的是「怎么把它挖出来」。

thinking 的另一面:原地找钥匙

WikiProfile 的题目均为单步事实问答,按理说让模型多想也帮不上忙。但实测数据显示:

  • 已存入但未直接回忆出的事实,thinking 能找回 40%–65%;
  • 压根没存入的事实,thinking 只能找回 5%–15%。

收益最大的位置,恰好是最堵的两个位置:Gemini-3-Pro 的冷热门差距从 21.4 个百分点收窄到 12.5 个,GPT-5 的正反向差距从 9 个收窄到 2 个。姊妹论文《Thinking to Recall》给出的机制解释是两条:一是思考 token 充当计算缓冲,为模型争取额外隐式算力;二是模型先吐出的相关事实充当语义桥,与人类认知中的「扩散激活」类似。但论文同时警告:思维链中的中间事实若为编造,最终答案的幻觉概率反而更高。

扩规模补的是货,不是钥匙

以 Gemma 3 家族为尺子,参数从 1B 扩展到 27B:

  • 编码失败率从 85% 降至 23%;
  • 回忆失败在剩余错误中的占比却持续上升。

放到前沿模型上更极端:回忆失败已占 GPT-5.2 全部错误的七成以上,且模型越强、占比越高。研究团队由此判断,scaling 在事实层面正逼近天花板,存入率 95%–98% 已是极限,继续堆参数和数据带来的准确率提升正在快速缩小。下一段增益更可能来自后训练与推理阶段,即如何更高效地调取已存知识。

元认知:模型得先知道自己想不起来

研究最后把问题指向元认知(metacognition):模型需要先判断「这道题我直接答不上来」,才有理由开启 thinking 多想一会儿。换言之,当前的瓶颈已从「有没有知识」转向「能不能取出知识」以及「知不知道该去取」。

配套资源

  • WikiProfile 基准:2,150 条英文维基百科事实,配套 21,500 道题(2 道存入题、4 道自由作答、4 道四选一)。
  • 题库由 Gemini-2.5-Pro 生成、Google 搜索逐题验证、人工复核淘汰不足 2%。
  • 完整测一遍一个前沿模型约花费 500 美元,数据集已开源。
信源