桃子桃子快讯
返回首页
研究论文

Inherent 发布 27B 参数「AI 科学家」智能体 Faraday,在论文复现任务上超越主流大模型

Inherent 推出 27B 参数 AI 科学家智能体 Faraday,通过长程强化学习在论文图表复现任务上超越 Cl…

2026.08.15 · 周六3 分钟阅读

AI 公司 Inherent 近日发布了一款名为「Faraday」的 27B 参数「AI 科学家」智能体,声称在论文复现任务上超过了 Claude Opus 4.8 和 GPT-5.5 两款主流大模型。该模型通过长程强化学习(RL)训练,以编码智能体作为工具,旨在让 AI 学会严谨的科学实验能力,被视为迈向可跨领域创新的「AI 科学家」的一步。

核心成果:复现任务上超越前沿模型

Inherent 表示,Faraday 在其自建的复现任务套件上,对每一类论文都能生成比基线更忠实的复现结果,并在元学习、结构生物学和材料科学等领域优势尤为明显。最值得注意的是,Faraday 体量仅为 27B 参数,却在使用 Claude Code 和 Codex 框架、并将推理强度设为「extra high」的 Claude Opus 4.8 与 GPT-5.5 面前取得了更好成绩。

训练方法:Replica 任务集与长程 RL

为训练 Faraday,团队提出了 Replica——一个可扩展的 RL 任务空间。其初始套件包含来自 100 篇 ML 与 AI-for-science 论文的 310 个任务,覆盖自然语言处理、材料科学、天气预报等方向。每个任务要求智能体在有限的算力与时间预算下,复现论文中的一张图,且无法访问原始图表。

研究团队认为,复现看似缺乏创造性,但过程本身正是通向创新的跳板。论文只记录了「成功结果」,而智能体必须自行恢复那些「99% 的汗水」,这需要开放式研究特有的假设驱动探索能力。

评判机制:应对长程 RL 的不稳定

成功的复现不仅要求图本身精确,还需要严谨的实验设计、良好的科研规范、对论文主张的忠实以及资源的高效利用——团队称之为「研究品味」。他们为此设计了一个 LLM 评判器,并配合人类研究进行验证。针对长程 RL 训练中常见的奖励信号噪声问题,团队引入每任务专用评分细则(per-task rubric),并辅以多采样聚合和轮级信用分配(turn-level credit assignment),从而获得比 LLM 基线更稳定、与人类判断更一致的评分。

泛化与未来方向

Faraday 在推理时调用 GPT-5.5 Codex 作为工具,相当于「用更聪明的模型当实验助手」。更令人意外的是,它在训练阶段使用的是 GPT-5.4-mini,却能在测试时顺利迁移到更强的 GPT-5.5 Codex,体现出对前沿编码工具的适应性。

Inherent 强调,与已有的 AI Scientist 系列工作不同,Faraday 不需要手工编码的进化式控制框架,也没有测试时奖励信号——它学会「内在地珍视发现」。在安全方面,团队正在研究相关方法如何服务于可扩展监督(scalable oversight)并缓解奖励黑客(reward hacking)问题。

小结

Faraday 代表的范式是:在前沿编码智能体之上叠加一层「科学直觉」,让 AI 学会自主发现新知识。Inherent 将其视为新型 AI 研究机构的一部分,并表示公司内部已经在用 Faraday 加速科研流程。这一方向若被验证,将对 AI 辅助科学发现产生深远影响。

信源