Nature 报告:AI 尚难独立完成科研,影子评估揭示明显短板
Princeton 研究者用影子评估方法测试 AI 科研系统,在两项任务中仅获 2/6 和 1/6,证明当前 AI 还不…
AI 在科研自动化方面近年取得不少进展,但一项最新研究表明,计算机距离真正取代人类研究者仍有明显差距。Princeton 大学计算机科学家 Sayash Kapoor 及其合作者在 7 月末发布的 arXiv 预印本中提出了一套名为「影子评估」的方法,用比传统同行评审更严格的标准检验 AI 的科研能力。结果显示,被测试的 AI 系统在两项任务中分别仅得到 2/6 和 1/6 的评分,暴露出假设探索不充分、自我纠错不足等系统性问题。
背景:AI Scientist 的兴起与争议
用 AI 推动 AI 自身研究是该领域的早期方向之一。2024 年,东京 Sakana AI 团队率先发布名为「The AI Scientist」的系统,尝试覆盖从创意生成到论文撰写与自评的完整科研流程;其改进版本于 2025 年 3 月在《Nature》正式发表。此前,该系统产出的论文曾被送往一个会议研讨会接受同行评审,其中一篇甚至达到了接收门槛。
但 Kapoor 指出,同行评审本身就不可靠,尤其在 AI 研究中难以稳定衡量论文质量。更广泛的担忧是,端到端自动化在当前阶段更擅长优化既有方法,而非产出真正的突破。
影子评估:让原作者打分
为提高评判标准,Kapoor 团队选取了两篇投稿至本年度 NeurIPS 会议的论文,分别对应「精确控制聊天机器人人格」和「某类神经网络的故障检测器」两个研究问题。研究者要求 AI 系统沿用这些论文的大方向自行展开研究并撰写论文,再交由原作者审阅——相比繁忙的同行评审者,这些作者对自身课题的细节和潜在贡献有更深入的理解。
系统在工程层面表现亮眼:它能在六天时间内、用约 3,000 美元的计算额度运行数百次实验而不陷入死循环,能完成扎实的文献综述,并主动捕捉自身的虚假陈述(幻觉),没有出现研究人员预期中的「奖励黑客」行为。
失败模式:过早收敛与自我纵容
然而,系统在两项核心任务上整体失败,原作者给出的评分仅为 2/6 和 1/6。其典型问题包括:
- 选定少量假设后过早收敛,方案受阻时回溯不足;
- 后续自我评审不够严格,未能及时否定错误方向;
- 为维持结论成立而不断削减排他性预测,最终输出几乎无新意的内容。
Kapoor 在采访中总结道:「我认为完全自动化的开放式研究在当下并不在可预见范围内。」这项研究为业界对 AI 科研能力的乐观预期提供了重要的冷静参照。
技术实现简述
该系统基于 Claude Opus 4.8 大模型构建,运行在经过修改的智能体系统 OpenClaw 之上,外层包裹了一套包含通用指令与进度检查的「脚手架」。模型被赋予创建子智能体、访问互联网与软件库、调用计算资源以及模拟同行评审等多种工具,从而具备了相对完整的科研动作空间。
