18 个前沿模型自主研究能力大规模评测
153 次自主运行测试 18 个前沿大模型在 nanoGPT 优化任务上的表现,模型间差距贯穿整个研究流程。
一项大规模实验系统性地评估了 18 个前沿大模型在自主研究任务上的能力差距。研究者在 nanoGPT 优化器 speedrun 任务上完成了 153 次自主运行,单次运行最长持续 8 天、配备 8 张 H200 GPU,并按模型配置了多个随机种子。结果显示,模型之间的能力鸿沟贯穿「选实验—执行实验—解读结果」整个研究流程;没有任何模型产出全新方法,但表现分层十分显著。
实验任务:让模型自主压低训练步数
speedrun 的目标是训练一个 124M 参数的 GPT 模型,以尽可能少的训练步数达到验证损失 3.28。研究者设定的基线为 3,290 步(在其自行验证的标准下通过),人类当前的最佳纪录为 2,600 步(一个尚未合并的 PR)。模型获得训练脚本(含基线超参数)、规则文件 program.md 和一条启动指令,全过程需自主运行。
运行在沙箱中进行(bwrap + 网络命名空间),模型仅能访问自己的工作目录、只读数据集和 Python 环境;唯一对外通道是仅放行模型 API 的日志代理。为防止取巧,记录需在固定随机种子上训练 8 次取均值,验证阈值进一步收紧至 3.27859,使纯靠运气通过的概率约千分之一,与上游仓库的统计规则保持一致。
关键结果:能力分层贯穿全流程
最引人注目的发现是,模型差距在研究全流程均有体现:选择哪些实验、执行是否严谨、如何解读噪声结果,强者全面领先。最佳成绩如下:
- Fable 5(claude-code · high):2,726 步,较基线提升 81.7%
- Opus 5(claude-code · max):2,920 步,提升 53.6%
- Kimi K3(prime-agent · max):2,930 步,提升 52.2%
- Kimi K3(kimi-code · max):2,974 步,提升 45.8%
- Opus 4.8(claude-code · max):3,018 步,提升 39.4%
- GPT-5.6 Sol(codex · xhigh):3,042 步,提升 35.9%
排名靠后的模型包括 Grok 4.6、Muse Spark 1.2/1.1、GPT-5.5、Kimi K2.7 以及 GLM 5.3,其中 GLM 5.3 未能产出有效结果。研究者特别提到 Claude Fable 5、Kimi K3 和 GPT-5.6 Sol 的表现难以事先预测,并指出这批模型此前在「提出新想法」上普遍偏弱。
约束机制与数据公开
所有运行均在沙箱中执行,模型无互联网访问权限。这一限制是为了避免模型过度复用现有 PR、阻碍新方法的涌现。研究者还部署了一个独立 LLM 监控每小时审计每次运行,在数百次报告均未发现作弊或沙箱逃逸后停止监控,只在导出结果时再做核查。
所有数据均已公开:运行轨迹、草稿本、开源模型的推理流、监控报告、逐次账本以及实验框架代码均托管在共享研究仓库中,供社区复核与后续研究使用。
与行业既有实践的对比
研究者强调,这是同类实验中首次以如此规模公开进行:长达 8 天的运行、8 张 H200 的算力配置、覆盖 18 个模型。对比之下,Anthropic 内部自动 AI R&D 评估在 CPU 节点上优化模型,OpenAI 在 GPT-5.6 Sol 系统卡中仅报告使用 nanoGPT Track 1 与单张 H100 运行不到一天。
虽然研究者提醒,speedrun 中开发出的优化方法未必可直接迁移到真实模型训练,但紧凑的反馈循环与逐步爬升的特性使其成为评估 AI 自主研究能力的有趣试验场,也为后续关于「递归自我改进」的讨论提供了首批可复核的实证数据。
