Ornith-1.5 开源模型家族发布:三档规格、对标前沿闭源
Ornith-AI 在 Hugging Face 发布 Ornith-1.5,含 9B / 35B-MoE / 397B…
开源大模型家族 Ornith-1.5 近日在 Hugging Face 与 Reddit r/LocalLLaMA 上发布,提供 9B Dense、35B MoE 与 397B MoE 三种规格,覆盖从轻量到超大参数范围,官方公布的基准成绩声称可与顶尖闭源模型对标。
模型规模与架构
Ornith-1.5 由团队 Ornith-AI 推出,包含以下三档配置:
- 9B Dense:纯稠密架构
- 35B MoE:混合专家模型,激活参数规模为 A3B(3B 激活)
- 397B MoE:大规模混合专家,内含 DeepSWE 56 子型号
模型采用「self-improving」自改进训练策略,但原帖未披露训练数据、训练步数、对齐方法(如 RLHF / DPO)等更多细节。
基准测试表现
官方列出的成绩覆盖推理、Agent 与代码任务:
- Terminal-Bench 2.1:86.1
- SWE-Bench Verified:86;Pro:65.1;Multilingual:79.6
- DeepSWE:56
- HLE:44.6
- ClawEval:81.4
- Tool Decathlon:71.2
原帖称 Ornith-1.5 在同尺寸开源模型中达到 SOTA,并声称在上述任务上「delivers performance comparable to Claude Opus 4.8」。需要指出的是,Anthropic 公开版本谱系中并未出现过「Claude Opus 4.8」这一编号,原文可能为笔误或非官方表述。
开源与获取渠道
模型权重已上传至 Hugging Face 集合页:
- huggingface.co/collections/ornith-ai/ornith-15
目前的主要信息来源为社区用户 u/KokaOP 在 r/LocalLLaMA 的首发介绍贴,尚未见到 Ornith-AI 的官方博客、技术报告或经一线媒体核实的报道。
验证情况与注意事项
该消息源为 Reddit 社区帖与 Hugging Face 模型集合页,发布方知名度较低、缺乏官方技术文档,「Claude Opus 4.8」等版本号描述也与公开信息不符,因此相关 benchmark 数字尚需谨慎看待。建议关注者在选择接入前等待独立第三方复现或权威评测(如 LMSYS、Artificial Analysis 等)的交叉验证。
