Stanford 联合 Terminal-Bench 推出科研智能体基准 Terminal-Bench-Science 0.1
Stanford 主导的 Terminal-Bench-Science 0.1 基准发布,含 70 项科学家贡献的真实科…
Stanford 大学研究人员与 Terminal-Bench 团队联合发布 Terminal-Bench-Science 0.1 基准,旨在以科学家自贡献的真实科研工作流,衡量 AI 智能体在科研任务中的实际能力。首批 70 项任务覆盖生命科学、物理科学、地球科学、数学科学及工程科学五大领域;当前最强模型 Claude Opus 5 仅取得 30% 的解决率,表明前沿 AI 在真正科研场景下仍有显著提升空间。
基准定位:从代码到科学的延伸
Terminal-Bench 此前在软件工程智能体评测中推动了行业进展,Terminal-Bench-Science 则把同样的评测理念带入科学发现领域。该基准的目标是打造可承担技术性高、耗时长的科研工作流(如数据分析、模拟、证明编写、图像重建等)的 AI 智能体,让科学家将更多精力投入到需要人类判断的关键环节——研究问题定义、假设形成、结果解读与沟通。
任务设计:科学家主导、可验证
区别于教材习题或标准化练习,Terminal-Bench-Science 的任务全部由一线科研人员通过 GitHub 开放流程提交,涵盖以下能力维度:
- 数据分析与统计推断
- 仿真与优化
- 定理证明
- 图像重建与信号处理
- 逆问题、传感器标定、模型拟合、分类、科学机器学习等
任务经过领域审稿人、技术审稿人及「bar raiser」三层审核:领域审稿人评估科学性与真实性,技术审稿人检查任务构造与验证机制,最终质量把关确认任务对前沿智能体足够困难且非当前已能轻松完成。首批 920 项提案中,仅 464 项获批实现,386 个 PR 被打开,最终仅有 70 项进入 0.1 版本,严苛的筛选比例凸显了构建兼具科学价值与评测严谨性任务的难度。
初步评测结果
Terminal-Bench-Science 0.1 的公开排行榜显示:
- Claude Opus 5(Claude Code):30.0%
- GPT-5.6 Sol(Codex):22.4%
- Claude Fable 5(Claude Code):21.4%
- Claude Opus 4.8(Claude Code):10.5%
- GPT-5.6 Terra(Codex):8.6%
- GLM 5.3(Claude Code):8.1%
- Kimi K3(Claude Code):7.1%
- Grok 4.6(Grok Build):7.1%
- GPT-5.6 Luna(Codex):3.3%
即便是表现最佳的模型,也有 70% 的科研任务无法完成;多数主流模型的解决率集中在个位数区间。
持续迭代机制
Terminal-Bench-Science 被定位为「连续基准」而非一次性发布物。任务通过 Discord #tb-science 频道与 GitHub 公开任务看板持续接收新工作流贡献,旧任务也会随前沿模型能力变化而更新,形成「科学社区—前沿 AI 智能体—评估改进」的反馈闭环。这一机制旨在避免传统科学基准「发布即被弃用」的命运,让评测标准始终与 AI 前沿同步演进。
