AI 科研智能体出现全流程评测新框架
论文提出「发现回合」框架,以科研全流程轨迹评估 AI 的发现能力。
2026 年 8 月 19 日,预印本《Measuring AI Scientists: From Exams to Discovery》提出名为「发现回合」的 AI 科研评价框架。该工作由深度原理联合微软研究院、斯坦福大学、FutureHouse、Edison Scientific、艾伦人工智能研究所和加州大学伯克利分校等机构完成,试图把评价重点从知识考试中的最终答案,转向假设生成、实验执行和结果解读的完整科研轨迹。
从最终答案转向完整过程
论文指出,HLE 等闭卷考试主要衡量知识与答题能力,难以判断 AI 是否能识别异常、反思失败并形成可执行实验。新框架围绕科研假设、方案执行、实验结果解读三个阶段设置评估维度,并加入全流程闭环测试。
该体系还将失败实验视为重要数据,关注系统能否在试错中修正方向,而非只展示成功结果。这一思路将「AI 会不会答题」扩展为「AI 能否在约束条件下推进真实发现」,并要求科研成果具备可验证性和独立性。
产学研共同设计评价框架
论文已在 ChemRxiv 以预印本形式发布,DOI 为 10.26434/chemrxiv.15007582/v1。作者包括 FutureHouse 和 Edison Scientific 创始人 Andrew White、ScienceWorld 核心开发者 Peter Jansen、Terminal Bench 通讯作者 Ludwig Schmidt 等学者,诺贝尔化学奖得主 Frances Arnold 也被列为作者。
按照文章说法,深度原理是参与该论文的唯一中国产业代表,并以真实研发管线经验参与框架设计。论文提出的核心概念「发现回合」,用于描述 AI 推进一次科学发现的完整过程及其关键决策。
MIRA 展示产业实践
深度原理的 MIRA 平台被文章用作新框架的现实样本。平台采用三层架构:上层由多智能体规划协作,中层连接高性能计算与自动化实验室,底层沉淀可复用的科研记忆,覆盖假设生成、模拟计算、实验验证与知识沉淀。
文章还称,平台基于 React-OT 等专业模型串联科研流程,其中 React-OT 可在 0.4 秒内计算化学反应过渡态。据文章披露,MIRA 在 Research Claw Benchmark 获综合第一,在 Science Agent Arena 也以 81.1% 的综合分排名第一,同时保持较低的单项任务平均成本。不过,摘录未提供完整测试方法、成本定义、参评系统设置及重复实验数据,榜单结果仍应视为待独立核验的公司披露。
新标准仍需开放验证
如果后续研究能够证明该框架与真实科研产出、研发效率及成本稳定相关,它可能成为 AI 科研智能体的重要评价工具。框架的推广还需要公开任务集、评分标准、失败案例和第三方复现结果。相较于单一排名,AI4S 的评价重点由答案正确率转向完整发现过程,更值得关注。
