桃子桃子快讯
返回首页
研究论文

Loka、Arcee 等团队联手后训练开源模型做科研

Loka、AWS、Arcee AI 与 Prime Intellect 联合后训练开源模型用于科研工具调用与生物学推理,…

2026.08.11 · 周二4 分钟阅读

Loka、AWS、Arcee AI 与 Prime Intellect 联合发布了一项后训练研究,将一款开源模型微调为可在科研工作流中调用工具、跨多条不完整证据推理、并输出可复核结论的助手。项目设定是单次后训练要么问生物医学问题,要么接收蛋白证据后输出严格的 JSON 结果,并保留可被第三方回放的工作记录。

研究目标与背景

团队此前的 Trinity Mini 项目用同款开源模型做过药物–蛋白关系分类,本次要解决更复杂的任务:模型需要在工具辅助下调研一个科研问题,从残缺的证据中推理,再把可审计的工作证据交付给其他研究者。围绕这一目标,团队构建并公开了两个强化学习(RL)环境,并开展 21 次受控后训练实验,挑选在两类任务上均表现良好的配置。

两个强化学习环境

Drug Tool:呈现一个生物医学问题、一份工具目录与一个完成合约。模型需要挑选并参数化工具,在检索失败时恢复路径,最后给出简洁综合结论。环境默认覆盖 PubMed、GEO、KEGG、UniProt、STRING 等七个检索工具,可选启用由 NVIDIA NIM 支持的蛋白折叠、配体对接与分子生成工具。同一 rollout 中相同的调用会被缓存,结构化结果可在有状态工具间传递。

BioReason:在 BioReason-Pro 基础上构建,包含 8,630 条训练 + 评测记录,将蛋白元数据与序列与 InterPro、互作、亚细胞定位等证据结合,每条还附 GO-GPT 给出的候选 GO 词条。模型必须评估这些「带噪声」的候选,而不是把它们当作标签复制,最终返回且只返回一个 JSON 对象,包含分子功能、生物过程与细胞组分三类 GO 标识符与功能摘要。

关键结果

最终被选中的配置是 Run 120:

  • Drug Tool 评测分数从 70.8% 提升到 81.2%,且每个评测点都有上升。
  • BioReason 上综合得分 0.863,涵盖 GO 词条 F1、GO 树相似度、方面覆盖度与 JSON 合法性。
  • 在后训练前的一次 GEPA prompt 搜索,让基座模型在 BioReason 验证集上提升约 84%,在 Drug Tool 上提升 7.7%,这两项数字衡量的是提示词搜索阶段的验证表现,与后训练最终结果相互独立。

模型选择还参考了工具调用轨迹、验证器输出、引用、标识符、结构化响应以及一个真正可运行的科研应用中的行为。

奖励与评测设计

Drug Tool 的奖励综合「接地气的事实」+「工具调用成败」+「工具选择与参数合理性」+「完成度」+「效率」+「简洁度」+「最终回答质量」。诊断信息记录了幻化出的标识符、工具错误、限频、重复调用与证据重叠——刻意把「检索失败后的流畅回答」与「基于证据的综合回答」区分开,把「调了一堆工具但没结论」也扣分。

BioReason 的验证器评估三方面的 GO F1、平均 GO F1、树相似度、方面存在性以及严格的 JSON 合法性。最终目标在保留格式正确性的同时,重点奖励「与证据相符」的方面。

数据与训练配比

Drug Tool 的 SFT 数据来自 Loka 药物发现应用的 prompt bank,由 Arcee Trinity Large Thinking 通过 OpenRouter 的 OpenAI 兼容接口生成助手与工具轨迹,共 800 条训练 prompt、200 条评测 prompt,覆盖 17 个工作流类别,合计 5,049 次结构化工具调用。两个 Prime RL 环境按等比例混入训练,确保「调查」与「结论」两类能力都被覆盖。

工程与运营意义

论文还指出,把模型保持为「紧凑的开源模型 + 小型 LoRA 适配器」的形式,有现实的运维意义:既可以跑在企业自有的云边界内、固定到已知策略版本、针对自有证据与规范更新,又能让团队控制数据通路、奖励、评测、服务成本与事故响应,从而与科学层面「更好反馈带来更好科研行为」的论点互为补充。

信源