Prime Intellect实验:Harness加持下开源模型可逼近闭源旗舰
Prime Intellect用多智能体Harness让18个前沿模型自主优化训练脚本,Kimi K3跑出2930步逼近…
开源AI基础设施公司Prime Intellect最新发布的一项研究提出,借助多智能体Harness框架,可以把执行与监控交给更便宜的开源模型,把判断留给更强的模型,从而让「AI开发AI」以更低成本跑通——即便模型本身不是最强,也可能在试错吞吐量上追上来。实验中,18个前沿模型被投入nanoGPT优化器速通任务,开源权重模型Kimi K3搭配Prime Agent Harness后跑出2930步的成绩,超过了GPT-5.6 Sol的3042步,距离Claude Opus 5的2920步仅差10步。
实验设计:nanoGPT优化器速通
Prime Intellect的实验并非比拼「凭空发明新算法」,而是把模型扔进一个目标明确、反馈快速的真实训练任务:让Agent像人类研究员一样不断提出假设、跑实验、看结果、再迭代。
- 任务目标:用尽可能少的training steps,把1.24亿参数GPT的验证集loss降到3.28以下
- Baseline:3290步
- 人类公开纪录:2600步
- 算力配置:统一运行在8张H200上,全程断网并锁进sandbox
每次启动后,Agent会拿到三样东西:代码仓库、规则手册和目标指令。改优化器、写代码、启动训练、比较loss、判断结果是否噪声、决定下一轮实验方向,全部由Agent自主完成,人类基本退出。
实验规模与主要结果
最终Prime Intellect共跑了153次全自主实验,单次最长持续超过8天。参与测试的模型包括Fable 5、Opus 5、GPT-5.6 Sol、Kimi K3、Grok 4.5/4.6、GLM 5.2、Muse Spark 1.1/1.2、DeepSeek V4 Pro、Qwen 3.8等共18个。
结果上,Fable 5跑出最好成绩2726步,从3290步baseline到2600步人类纪录的690步优化空间中,吃掉了约564步(≈82%)。Kimi K3的2930步成绩,在开源模型中表现突出。
一个多少有些「扫兴」的发现是:没有任何一次实验提出真正意义上全新的方法。最终有效的招数——normalization、学习率调整、权重平均、optimizer技巧——基本都能在已有研究中找到对应思路。
真正拉开差距的是什么
既然idea都差不多,那么区分模型表现的,就不是「想到什么」,而是「怎么把它试出来」。Prime Intellect总结了强模型与弱模型在三方面的差异:
- 不轻易判死刑:强模型在seed跑差时会换seed重新消融甚至捡回旧方案重测。Opus 5重新调β2后刷出新纪录,Fable 5一次重新探测旧方案又省下31步。
- 更会处理噪声:会先判断小幅提升是真实改进还是随机波动,再决定要不要继续烧算力。有模型发现同一seed重复跑也会因GPU非确定性产生loss波动,并据此重做实验流程。
- 会自己造工具:Kimi K3会写实验函数、比较loss曲线、恢复baseline,甚至搭建小型实验室先验证Newton-Schulz再带回真实训练;这背后是Prime Agent Harness提供的持久运行IPython内核,让K3能够围绕研究任务自主搭建工作流。
换句话说,在这个任务里,科研能力越来越像一个试错吞吐量问题:能不能多试几个方向、更快排除错误、抓住微弱但真实的信号并把它们一轮轮叠起来。
多智能体Harness的意义
既然大量工作落在写代码、跑实验、盯结果、做验证这些环节,就没必要每一步都调用最贵的前沿模型。Prime Intellect给出的方案是:让更便宜的开源模型负责监控与实现,把真正需要判断的环节留给更强模型。「同样的钱能跑更多实验,同样的实验也能更快跑完」。
当一次试错越来越便宜,AI科研能力的提升就不一定非得等下一个更强的模型——把底下这套「试错机器」造得更好,本身就能继续把成绩往上推。Prime Intellect下一步计划把这一Speedrun扩展到训练栈的更多环节,并继续放大实验规模。
对AI4AI路线的启示
这一结果一定程度上动摇了最经典的RSI剧本:最强闭源模型率先跨过「AI开发AI」临界点、不断自我迭代、最终赢家通吃。它展示了另一种可能——模型不必最强,只要底下的科研机器足够高效,开源模型同样可以靠更高的试错吞吐量追上来。
对人类研究员而言,idea本身往往很便宜,真正拉开差距的是infra迭代速度;放到AI4AI里道理类似:未必需要每一步都让极其聪明、昂贵的模型亲自下场,更需要解决的是让一个还不错的模型以足够低的成本把实验循环跑得足够快。从这个角度看,决定速度的不只是上面那个模型有多聪明,下面那套让它不断试错的机器同样重要。
