桃子桃子快讯
返回首页
开源

Ornith-1.5 三档权重齐发:让模型自己出题自己练

Ornith 发布 397B MoE、35B MoE 与 9B Dense 三档开放权重,引入模型自出题、自搭脚手架、自…

2026.08.27 · 周四5 分钟阅读

Ornith 一次性放出了 397B MoE、35B MoE 和 9B Dense 三档 MIT 权重,并把一项相当激进的训练机制塞进了强化学习流程:模型不再只负责解题,还要自己生成训练任务、自己搭建解题脚手架、自己跑出轨迹,奖励则从轨迹回传给全部三段。三件事首次在同一个闭环里被同时优化。

核心思路:把「课程设计」也学出来

高质量的智能体训练任务长期是稀缺品:题要有判分逻辑、要能跑得起来、难度还要恰好踩在模型「差一口气」的位置上。人工整理速度远远跟不上模型的消耗速度。Ornith-1.5 的回应是把「出卷」这件事也交给模型。

给定一个代码库和一段关于任务类型的高层说明,外加模型自己过去的解题记录,系统会:

  • 先按模型当前能力生成一批比已会题再难一档的新题;
  • 再为每道题生成或改进专属脚手架(指令、工具、拆解策略、编排逻辑);
  • 最后在任务与脚手架双重条件下跑出解题轨迹。

奖励通过 GRPO 反向传给三段,「出题」「搭台」「解题」从此形成策略越强 → 题目越难越有信息量 → 脚手架越能把能力榨出来 → 轨迹质量再喂回学习信号的飞轮。

防废题:三项奖励相乘,缺一即零

听上去很美,但很容易想到破绽:模型若给自己出送分题,分数照样能刷爆。Ornith 的办法是把任务奖励拆成三项相乘——有效性、前沿难度、新颖性,任何一项接近零,整道题奖励归零。

  • 有效性(硬门槛):脚手架跑不跑得起来、高置信度正确解能不能通过、明显错误的解会不会被判失败。任一不过关,直接判零,专拦「看着难、其实判不出对错」的废题。
  • 前沿难度:对每道题采样若干轨迹算经验成功率,目标值定在 0.2 附近。十次里做成两次才是一道好题——做成八次已经会了,一次都做不成则攒不出成功轨迹,RL 同样空转。靶子随模型能力自动爬升,无需人工调难度。
  • 新颖性(权重最低):只负责去冗余,避免重复出同一道题的变体;官方明确其优先级低于前两项,不奖励怪题。

基准成绩与一张必须说清楚的尺子

按 Ornith 团队自测(取五次独立运行均值,4 小时超时、32 核 CPU、48GB 内存),Terminal-Bench 2.1 上:

  • 397B MoE:86.1,比两个月前 Ornith-1.0 的 77.5 涨 8.6 个百分点;
  • Ornith 自测的 Opus 4.8:85.0;
  • 官方榜单核验的 Opus 4.8(Claude Code 配置):78.9,排第 5。

同一个 Opus 4.8,两张表相差 6.1 分。原因在于 Terminal-Bench 类基准测的是「模型 + 脚手架 + 超时 + 上下文 + 资源配置」的组合成绩,换一套配置分数就换一层含义。截至 2026 年 8 月 19 日,Terminal-Bench 2.1 官方验证榜单 17 项中并没有 Ornith-1.5。因此项目自测成绩与官方榜单不能放进同一个排名里读。

此外,MIT 许可证只覆盖权重本身,公开仓库目前主要是 README、LICENSE 和展示素材,没有 1.5 完整训练实现、训练任务集,也没有可复现的评测脚本。开放权重,不等于全套开源。

中小尺寸才是真正能用得上的两档

旗舰负责上热搜,中小尺寸决定多少人真的用得上。

  • 35B-A3B(MoE,每 token 激活约 3B):Terminal-Bench 2.1 跑 67.8,对比 Gemma 4-31B 的 42.1 和 Muse Glimmer-30B 的 51.7 高出一截;SWE-bench Verified 上 79.0 对 52.0。激活 3B 打赢 31B 稠密,是这组发布里性价比最高的一档。
  • 9B Dense(面向端侧):Terminal-Bench 46.2,SWE-bench Verified 70.6,GPQA Diamond 86.4,5.63GB 压缩权重与 MLX 格式均已在 Hugging Face 上放出。

不过 9B 也不是全面压制 Gemma 4-31B:在 MCP-Atlas(54.2 对 55.0)和 Toolathlon-Verified(41.2 对 52.8)上落后,这两项考的是多轮工具调用、按状态改计划,长链条一旦拉长,9B 的容量就撑不住了。编码和推理能靠训练方法补回体量差,工具调用补不回来。

开放权重追赶闭源的新一条路

从 6 月的 1.0 到 8 月的 1.5,Terminal-Bench 自测在两个月内提升约 11.1%。比数字更重要的是能力的成长方式:1.0 学的是「怎么解」,1.5 开始学「该练什么」——数据生产这道工序,被整个搬进了强化学习闭环。

堆参数、抄配方之外,开放权重阵营正在多出一条路:自己造题。谁能持续造出好题,谁就握着持续变强的燃料。只是当出题、搭台、解题三件事都交给模型,人类留在这个闭环里的位置,也随之需要被重新定义。

信源