模型发布
Ornith-1.5-397B 模型基准成绩曝光 含端侧移动版
Ornith-1.5-397B 在 Terminal-Bench 与 SWE-bench 等编码基准表现亮眼,同步推出…
2026.08.19 · 周三约 2 分钟阅读
Ornith-1.5-397B 近日曝光了一组面向编码任务的基准成绩,覆盖 Terminal-Bench、SWE-bench Verified、DeepSWE 等多个测试。据 TestingCatalog 在 X 上的消息,全量 397B 模型在 Terminal-Bench 2.1 上取得高于 85.1 的分数,在 SWE-bench Verified 上超过 86,在 DeepSWE 上超过 56(均为五次运行的均值)。这一表现在开源权重模型中处于靠前位置,尤其在软件工程类基准上接近一线闭源模型的水平。
多尺寸与 MoE 设计
除旗舰 397B 版本外,该系列还包含 35B 中型变体,单 token 仅激活约 3B 参数,属典型的稀疏激活(MoE)结构。35B 版本在相关编码基准上分别取得 68.5 与 79 的成绩,相比全量模型有约 15 分左右的差距,体现了 MoE 路径在效率与能力之间的权衡。
面向移动端的量化版本
项目还同步发布了一个 9B-Mobile 量化构建版本,目标设备为 iPhone 与 Android,意在将编码 Agent 推到端侧运行。若实测可用,意味着开发者可以脱离云端推理,直接在手机上完成一定复杂度的代码生成与终端操作类任务。
信息核实与待验证项
目前公开渠道仅来自 TestingCatalog 的社交媒体帖子,原文中未指明背后的研发主体、训练数据构成与许可证类型,所列基准成绩也未附完整测试报告或第三方复现链接。读者在引用上述数字时,建议结合权重仓库中的完整表格与社区复现结果交叉确认,避免单方面采信。
