研究论文
AutoWorldModel-Bench:用世界建模任务评测 AI 智能体科研能力
研究团队发布 AutoWorldModel-Bench 闭环基准,以 8 个游戏环境测试前沿编码智能体的开放式科研能力,…
2026.08.13 · 周四约 2 分钟阅读
近期,arXiv 上发表了一项面向「AI 编码智能体能否独立做科研」这一议题的新基准——AutoWorldModel-Bench。与当前主流的智能体评测(多为「按规格完成工程任务」)不同,该基准将世界建模(world modeling)作为试验场,让前沿编码智能体在固定算力预算下,自主迭代改进给定的世界模型初始版本。
基准设计:聚焦状态,隔离感知
世界建模是一个架构、训练目标与状态表示高度耦合、且目前不存在单一最优方案的领域,因此被该团队选作智能体科研的理想测试床。AutoWorldModel-Bench 包含 8 个游戏环境,所有环境统一采用一种「结构化状态表示」:
- 从每个游戏提取出 ground-truth 实体状态;
- 通过共享的 tensor 格式供模型消费;
- 将「动力学建模」与「感知」解耦,使每次运行可在分钟级完成迭代。
这种设计让智能体不必纠缠于视觉或感知模块,而专注于建模方法本身的改进。
实验设置与结果
团队在固定算力预算下进行了 64 次闭环会话评估,被测智能体为 Codex-5.4 与 Claude Opus 4.6:
- 64 次会话中,智能体在 63 次成功改进了 starter 版本;
- 其中 91% 的胜出编辑属于「非平凡的科研式修改」,例如引入新目标函数、新的表示方式、新的 rollout 流程或架构变更;
- 仅约 9% 是超参数微调。
这意味着在该基准下,智能体的有效产出集中在方法论层面,而非工程调优层面。
为何值得关注
当前主流智能体评测多停留在「按规格实现功能」的工程层面,对「方向未给定」的科学探索能力缺乏衡量。AutoWorldModel-Bench 提供了一个相对低成本、可重复的实验环境,使研究者可以系统比较不同前沿编码智能体在开放式科研任务上的表现差异,补充了现有 agent benchmark 的空缺。
局限性方面,由于目前仅覆盖 8 个游戏环境,且仅测试两款智能体,该基准对更广泛任务与模型的泛化结论仍需后续工作验证;但其「以世界建模测智能体科研能力」的思路,为 agent 评估方向提供了一个值得跟进的新切入点。
