桃子桃子快讯
←返回首页
研究论文

AI 进展预测准确性回顾:专家系统性低估基准能力

FRI 汇总自 2022 年以来的 AI 预测,发现专家与超级预测者在基准能力上系统性低估进展,扩散指标表现参差。

2026.09.27 · 周日约 3 分钟阅读

美国预测研究机构 Forecasting Research Institute(FRI)近日发布系列文章的第一篇,系统回顾了自 2022 年中期以来对 AI 进展预测的准确性。研究涵盖专家与具有长期准确记录的「超级预测者」(superforecasters)在多个维度上的表现,包括基准与非基准能力测试、采用与扩散指标、社会影响、以及地缘政治与治理。

主要发现:基准能力被系统性低估

研究的核心结论是:在多个 FRI 研究中,预测者对 AI 在基准测试上的进展出现了「显著低估」(dramatically underestimate)。例如:

  • 在 Epoch Capabilities Index 等基准上,中国模型的性能预测整体偏保守;
  • 在 FrontierMath 等具体基准上,AI 达到特定水平的时点普遍早于预测;
  • 部分问题因里程碑提前到来而过早结案,这可能放大了「低估」印象,因为尚未结案的问题无法被评估。

与此同时,研究也记录了若干「高估」案例:

  • 2025 年中的一项研究中,预测者高估了 LLM 提升业余人员完成危险生物学任务能力的影响;
  • 中位数专家很可能严重高估了自动驾驶汽车到 2027 年底的普及程度。

采用与扩散:表现参差

在「真实世界」的 AI 采用与扩散类预测上,预测者整体表现更为复杂,仍倾向于低估,但波动更大。部分与扩散相关的问题(例如数据中心增长率)预测大致准确。

对宏观层面的经济与社会影响(包括 AGI 时间表与 GDP 冲击),研究指出目前证据尚不足以系统评估预测者的准确度,因为许多此类问题尚未结案,且未来学家之间分歧巨大。文中举例:Ajeya Cotra 与 Timothy Lee 对「自给自足 AI 系统」出现时点的预测相差约 40 年;Andrej Karpathy 认为实现 AGI 对 GDP 几乎无影响,而 Epoch 研究人员则建模出 AI 自动化可能带来超过 30% 的年经济增长。

研究方法与局限

FRI 的预测来源覆盖多个项目,包括 Existential Risk Persuasion Tournament(XPT)、AI 对抗性协作、LLM 生物风险研究、AI 网络风险试点、经济效应预测研究,以及 2025 年中启动的「纵向专家 AI 小组」(Longitudinal Expert AI Panel,LEAP)。LEAP 为面向顶尖专家与超级预测者的月度调查。

研究团队(Josh Rosenberg、Matt Reynolds、Nadja Flechner、Zack Devlin-Foltz)也明确指出了若干重要局限:

  • 早期结案问题被重点讨论,可能引入偏差,导致低估现象被放大;
  • 对部分未结案问题,团队使用了 LLM 投影来得出初步结论,这类结果更具推测性。

FRI 表示将在后续文章中讨论如何改进 LEAP 预测的准确性与相关性,并持续发布准确度更新。这项工作为政策制定者与研究者理解 AI 进展预测的可靠性提供了量化依据,也凸显了在快速变化的 AI 领域,预测方法本身仍需不断校准。

信源