AI 进展预测准确性回顾:专家系统性低估基准能力
FRI 汇总自 2022 年以来的 AI 预测,发现专家与超级预测者在基准能力上系统性低估进展,扩散指标表现参差。
美国预测研究机构 Forecasting Research Institute(FRI)近日发布系列文章的第一篇,系统回顾了自 2022 年中期以来对 AI 进展预测的准确性。研究涵盖专家与具有长期准确记录的「超级预测者」(superforecasters)在多个维度上的表现,包括基准与非基准能力测试、采用与扩散指标、社会影响、以及地缘政治与治理。
主要发现:基准能力被系统性低估
研究的核心结论是:在多个 FRI 研究中,预测者对 AI 在基准测试上的进展出现了「显著低估」(dramatically underestimate)。例如:
- 在 Epoch Capabilities Index 等基准上,中国模型的性能预测整体偏保守;
- 在 FrontierMath 等具体基准上,AI 达到特定水平的时点普遍早于预测;
- 部分问题因里程碑提前到来而过早结案,这可能放大了「低估」印象,因为尚未结案的问题无法被评估。
与此同时,研究也记录了若干「高估」案例:
- 2025 年中的一项研究中,预测者高估了 LLM 提升业余人员完成危险生物学任务能力的影响;
- 中位数专家很可能严重高估了自动驾驶汽车到 2027 年底的普及程度。
采用与扩散:表现参差
在「真实世界」的 AI 采用与扩散类预测上,预测者整体表现更为复杂,仍倾向于低估,但波动更大。部分与扩散相关的问题(例如数据中心增长率)预测大致准确。
对宏观层面的经济与社会影响(包括 AGI 时间表与 GDP 冲击),研究指出目前证据尚不足以系统评估预测者的准确度,因为许多此类问题尚未结案,且未来学家之间分歧巨大。文中举例:Ajeya Cotra 与 Timothy Lee 对「自给自足 AI 系统」出现时点的预测相差约 40 年;Andrej Karpathy 认为实现 AGI 对 GDP 几乎无影响,而 Epoch 研究人员则建模出 AI 自动化可能带来超过 30% 的年经济增长。
研究方法与局限
FRI 的预测来源覆盖多个项目,包括 Existential Risk Persuasion Tournament(XPT)、AI 对抗性协作、LLM 生物风险研究、AI 网络风险试点、经济效应预测研究,以及 2025 年中启动的「纵向专家 AI 小组」(Longitudinal Expert AI Panel,LEAP)。LEAP 为面向顶尖专家与超级预测者的月度调查。
研究团队(Josh Rosenberg、Matt Reynolds、Nadja Flechner、Zack Devlin-Foltz)也明确指出了若干重要局限:
- 早期结案问题被重点讨论,可能引入偏差,导致低估现象被放大;
- 对部分未结案问题,团队使用了 LLM 投影来得出初步结论,这类结果更具推测性。
FRI 表示将在后续文章中讨论如何改进 LEAP 预测的准确性与相关性,并持续发布准确度更新。这项工作为政策制定者与研究者理解 AI 进展预测的可靠性提供了量化依据,也凸显了在快速变化的 AI 领域,预测方法本身仍需不断校准。
