匿名大模型「牛来」刷屏,代码能力逼近头部
一款名为 Ox Alpha 的匿名大模型登陆 OpenRouter,具备 100 万 token 上下文与出色代码能力,…
8 月的大模型圈迎来一场匿名模型猜谜游戏。一款名为 Ox Alpha 的模型突然出现在 OpenRouter 平台,凭借接近头部水平的代码测试表现迅速走红,被国内开发者昵称为「牛来」。在身份尚未确认的情况下,多条技术线索将其指向智谱尚未发布的 GLM-5.3 系列。
「牛来」模型凭代码能力出圈
根据 OpenRouter 披露的信息,Ox Alpha 拥有 100 万 token 上下文,支持文本、图片和视频输入,可调用工具,目前限时免费。上线后,开发者迅速将其接入编码 Agent,放入真实代码仓库进行压力测试。
开发者 Ben Davis 从 DeepSWE 中抽取 10 项任务进行测试,Ox Alpha 完成其中 8 项,通过率达 80%。作为对比,他公布的同批测试中,Fable 5 Max 为 65%,GLM-5.3 Max 与 Grok 4.6 xhigh 均为 62%,GPT-5.6 Sol Max 为 52%。DeepSWE 考察的是真实软件工程能力,模型需阅读仓库、定位问题、修改代码、运行测试并根据报错继续修复,更贴近编码 Agent 的实际工作场景。
不过 10 项任务的样本偏小。随后其他开发者在另一组 DeepSWE 子集上测试,通过率约为 63%。两次测试的任务范围与运行配置并不一致,暂时无法据此确定 Ox Alpha 的准确排名,但初步结果已显示出较强的长程编码潜力。
多条技术线索指向智谱 GLM-5.3
「牛来」的身份目前流传最广的说法是智谱尚未发布的 GLM-5.3 Flash,或 GLM-5.3 的多模态版本。有研究者专门撰写博客给出三条主要证据:
- 视觉 token 完全一致:四段不同帧率、时长与分辨率的视频中,Ox Alpha 消耗的视觉 token 与 GLM-5V-Turbo 高度吻合,而 MiMo、Qwen、GLM-4.6V 表现出明显不同的特征。
- 文本 tokenizer 高度吻合:测试 25 组提示词后,Ox Alpha 与 GLM-5.3 的 token 数量始终保持固定的 75 token 差值。
- 行为特征相近:Ox Alpha 拒绝处理音频,与 GLM-5V 的路由方式一致;回答风格、Agent 执行步数与推理接口也接近 GLM 系列。
此外,智谱此前曾以 Pony Alpha 为代号匿名测试 GLM-5,具备类似操作先例。Ben Davis 表示「99% 确定这就是 GLM-5.x」。不过截至目前,OpenRouter 与智谱均未公开回应,身份仍待官方确认。
另一款匿名模型 korrine 同步现身
在「牛来」尚未揭晓的同时,Code Arena 上又出现了一款名为 korrine 的匿名模型,引发新一轮猜测。最初不少人联想到 Kimi K3.1,原因在于 Kimi K3 发布前曾被认为以 kivine 代号测试,而 kivine 与 korrine 结构相近。不过最早传播消息的爆料者随后补充称,此前获知的 MoMoonshot 新模型可能对应另一个代号 adamant-ananke,korrine 也可能来自 Qwen 等其他中国团队。评论区中还有人将其指向 MiMo V3,真实来源仍是悬念。
匿名测试为何成为发布前标配
匿名测试正在成为大模型正式发布前的重要环节。在 Arena 中隐藏厂商与型号,可以削弱品牌带来的先入为主,让用户仅根据实际输出做选择,积累的对战结果更贴近真实体验。
OpenRouter 则提供了另一类测试环境:开发者把模型接入各类编码 Agent,让其进入真实仓库,连续调用工具,处理长达数小时的软件工程任务。上下文能否保持稳定、工具调用是否可靠、模型会不会在长程任务中循环或跑偏,都能在此类高强度使用中迅速暴露。对厂商而言,这相当于一次公开压力测试,可在正式发布前观察失败案例、验证推理服务承载力并积累口碑。同时,「猜模型」本身也在成为一种营销手段,身份悬念可以显著拉长讨论周期。
如果 Ox Alpha 确为一款 Flash 模型,其代码能力已逼近头部水平,那么资源投入更高、能力更完整的完整版,又会把上限推到哪里?这或许正是当下大模型圈最期待揭晓的答案。
