Meta 提出 AI 研究偏好模型 RPM
Meta FAIR 提出 RPM,用相对排序替代绝对预测,提升 AI 研究智能体在固定算力预算下的研究效率。
Meta FAIR 团队提出「AI 研究偏好模型」(Research Preference Models,RPM),通过相对排序而非绝对预测的方式,在执行前判断哪些候选研究方案最值得投入算力,从而提升 AI 研究智能体(AIRA)在固定预算下的研究效率。
研究背景:方案太多,算力不够
AI 研究智能体已经能够自主提出、实现并评估机器学习实验。然而,写出一个候选方案只需几分钟,但验证其有效性却可能需要数小时甚至数天的 GPU 时间。智能体能提出的候选方案数量已远远超过其能负担的执行数量,因此「如何在固定执行预算下分配算力」成为决定研究进展的关键瓶颈。
RPM 的核心思路:用相对排序替代绝对预测
研究团队观察到,语言模型在预测绝对指标或执行结果时表现并不可靠。因此,RPM 不试图猜测某个方案最终能跑出多少分,而是把问题重新表述为相对排序问题:在真正投入算力之前,先对候选方案排序,找到最有希望的路径。
具体而言,他们基于冻结的预训练语言模型构建了两类 RPM:
- inference-only 模型:对候选计划、代码和先前执行过的方案进行推理;
- agentic 模型:先执行小规模试验,再据此做后续决策。
随后,这两类 RPM 被整合到 AIRA-dojo 搜索智能体中。
试点实验的两个关键机制
在 agentic RPM 的研究中,研究人员发现试点实验智能体在分配时间预算时容易过于保守,导致大量预算被闲置。为此,他们采用了两种机制:
- 在提示词中有意夸大剩余时间预算(报告数值是实际的数倍),避免智能体过早停止;
- 在每次提交后引入独立的反馈模型,审阅已有发现,提出下一步最有信息量的实验,或判断证据已充分、结束循环。
实验结果与局限
在 AIRS-Bench 上的评估显示,两种方案分别将平均归一化得分从 0.684 提升至 0.711 和 0.729,并能在约 15 小时内达到无引导智能体 24 小时才能达到的水平,且所用执行预算不到后者的 2/3。最优 RPM 模型还在两个 AIRS-Bench 任务上取得 SOTA 结果。
研究也指出若干局限:
- 当前实验假设 LLM 推理成本可忽略,实际存在延迟——以 Inference-only RPM 为例,扣除 0.660 小时推理延迟后,归一化得分从 0.711 微降至 0.708;
- 离线评估数据来自此前不同骨干模型、不同任务模态下的贪心搜索运行,属于离策略数据;
- RPM 仅在 AIRA-dojo 框架、单一骨干模型、单一基准上得到验证,其在父节点选择阶段的应用以及跨框架、跨骨干模型的可迁移性有待后续工作检验。
意义:让测试时计算花在「选」上
这项工作给出了一个系统化的路径:用相对比较取代脆弱的绝对预测,用历史轨迹补充判断上下文,并在必要时通过小规模实验获取更多证据。当实验验证远比方案生成昂贵时,把测试时计算投入候选选择本身,可能成为提升自动化研究效率的重要方向。
