桃子桃子快讯
返回首页
研究论文

27B 模型 Faraday 论文复现任务超越 Claude Opus 4.8 与 GPT-5.5

研究者提出 Replica 论文复现任务空间与 Faraday 27B AI 科学家智能体,在留出复现任务上声称优于 C…

2026.08.18 · 周二3 分钟阅读

近日发表于 arXiv 的论文《Training AI Scientists to Replicate Research》提出了一套面向论文复现的可扩展任务空间 Replica,并基于此训练了 27B 参数的「AI 科学家」智能体 Faraday。论文作者称,Faraday 在留出(held-out)复现任务上的表现超越了 Claude Opus 4.8 与 GPT-5.5,但目前该结论仅来自预印本,尚未经过同行评审。

研究动机:复现是科学知识的基石

作者在摘要中指出,论文可复现性是科学知识的基石,既能保证已有结论的可靠性,也为后续实验提供基础。真正的复现过程往往揭示原文中未充分说明的细节,因此其难度并不亚于开放式研究——既需要类似假设驱动的探索,也需要工程化的实验执行能力。围绕这一目标,团队构建了 Replica 任务空间,并尝试用强化学习后训练的方式,使 AI 智能体具备「AI 科学家」的科研复现能力。

方法:Replica 任务空间与 rubric 评分器

论文的核心贡献之一是提出 Replica,作为一个可扩展的论文复现任务集合,用以训练和衡量智能体在科研任务上的能力。具体包括两个关键设计:

  • 基于 rubric 的自动评分器:团队设计了一种由模型自动生成的「评分量表(rubric)」作为奖励信号,用以评估智能体的复现质量。论文声称该评分器噪声低,并与人类对复现质量的判断具有较高一致性,从而减少对昂贵人类标注的依赖。
  • 以编码智能体为工具:Faraday 本身并不直接执行所有操作,而是调用底层的编码智能体(coding agents)作为工具来完成实验代码编写、运行与调试等工作。

在后训练阶段,团队对 Faraday(27B 参数)进行了针对性训练。论文中并未公开全部训练细节,但指出其采用「post-train」范式,结合 rubric 评分器提供奖励信号进行优化。

结果:声称在留出任务上超越前沿模型

论文报告的核心结果如下:

  • 主结果:在 Replica 的留出复现任务上,27B 参数的 Faraday 表现优于 Claude Opus 4.8 与 GPT-5.5。
  • 定性分析:对个体 rollout(一次完整运行轨迹)的定性分析显示,Faraday 在方法上更接近「以科学原则为导向」的探索方式,而非简单的模仿或试错。
  • 定位:作者将这项工作视为迈向「长周期科学创新」智能体的踏脚石,目标是让 AI 智能体在不依赖复杂外部脚手架(harness)的情况下完成更长期的科研任务。

局限与待验证之处

需要指出的是,本文为 arXiv 预印本(编号 arXiv:2608.13331),尚未经过同行评审;论文中提及的对比基座 Claude Opus 4.8 与 GPT-5.5 均系闭源前沿模型,其在 Replica 上的实际表现难以独立复现。此外,论文全文 47 页、12 张图,但摘要中未披露具体的 rubric 构造细节、训练数据规模或评测置信区间。

总体而言,该工作将「AI 科学家」的研究方向从生成假设推进到完整执行复现实验,并展示了中小规模模型在特定任务空间上对前沿闭源模型的潜在超越;但相关结论仍有待社区独立验证。

信源