桃子桃子快讯
返回首页
研究论文

9GB 本地模型跑完 41 年 Jeopardy! 题库,答对 67%

研究者用 4-bit 量化的 Qwen2.5-14B(9GB)完整回答 1984–2025 共 52.9 万条 Jeop…

2026.08.31 · 周一3 分钟阅读

一项发表于 cs.AI 的 arXiv 论文把 1984 至 2025 年共 41 季 Jeopardy! 节目的全部 529,939 条题目拼成一个超大规模知识测试集,并用单个 9 GB 的本地开源模型跑完了这整份语料。结果显示,4-bit 量化的 Qwen2.5-14B 在严格强制作答协议下答对其中 67.0% 的题目,事实类(factoid)细分正确率超过 85%。作者称,这是首次有模型被完整跑过这份全量语料。

研究背景:从 Watson 到本地模型

2011 年,IBM 的 Watson 在 Jeopardy! 中击败人类冠军,但其所依赖的 DeepQA 系统运行在 POWER7 服务器集群之上,所用知识来自一份在构建时冻结、十亿文档级别的精选语料,既不可移动也无法复制。作者将这套系统比作「其时代的可查询知识密封舱」。本次研究则想说明:同类型的能力——一个文化能回答什么的快照——现在已经可以装进口袋,且基本免费。研究者使用的是单个 9 GB 大小的 4-bit 量化 Qwen2.5-14B,完全可在本地运行。

评测方法与协议

  • 题目总量 529,939 条,覆盖 1984–2025 年全部 41 季播出节目。
  • 评测协议为严格强制作答:模型必须给出回答,再以精确匹配与模糊匹配评分。
  • 训练数据泄漏被双方系统共同承担:作者指出 Watson 的语料本身就是为覆盖 Jeopardy! 答案而组装,并针对历史题目调优,反而是更极端的一侧。
  • 决定性测试是「模型能否答对其构建后才出现的题目」,即训练截止日期之后播出的线索。

关键结果

  • 整体正确率:Qwen2.5-14B(9GB,4-bit)在全部题库上答对 67.0%。
  • 事实类细分:正确率超过 85%。
  • 截止日期后的题目表现:
    • 本地 Qwen2.5-14B 保持 65% 正确率;
    • Claude Opus 4.8 保持 95% 正确率;
    • Watson 因设计上不可能答出未收录线索,正确率为 0%。

意义:可封装的、不会冻结的知识

作者的核心论点是:能力已经从「机房里的服务器」迁移到「一个可以塞进时间胶囊的文件」。Watson 的知识在构建那一刻就被锁死在它自己的时代;而即便是一个 9 GB 的小模型,对它诞生之后出现的新题目仍能给出 65%–95% 的正确率。这意味着现代语言模型携带的不仅是一份知识快照,而是一种可以跨越自身截止日期继续作答的泛化能力。

信源