桃子桃子快讯
返回首页
行业动态

中国大模型公司扎堆「匿名公测」海外

Ox Alpha 走红背后,中国大模型公司将匿名公测作为出海新打法

2026.08.24 · 周一6 分钟阅读

最近,海外开发者圈被一个叫 Ox Alpha 的匿名模型刷屏。它在 OpenRouter 上线不到一周,就凭借 100 万 token 上下文、图片视频输入、免费使用等标签迅速走红,并被接入 OpenCode、Hermes 等编程 Agent。

Ox Alpha 的真实身份至今未被官方确认,但社区通过 tokenizer、推理模式报错和输出习惯等线索,普遍猜测它来自智谱 GLM-5.x 系列。这并非个例——中国大模型公司正越来越熟练地借助海外开发者平台,将「匿名公测」作为出海的第一站。

从 HappyHorse 到 Ox Alpha:匿名公测成为新打法

事实上,今年已有多个中国团队通过匿名方式完成了模型首发。

  • 2 月,Pony Alpha 上线后被标注为 GLM-5 的早期测试版本;
  • 3 月,Hunter Alpha 被小米认领为 MiMo-V2-Pro 的早期版本;
  • 4 月,Elephant Alpha 揭晓为蚂蚁 Inclusion AI 的 Ling-2.6-flash。

往前推四个月,阿里的 HappyHorse 同样在没有发布会、没有公司名的情况下,直接空降 Artificial Analysis 的 Video Arena 榜单,一度超越字节 Seedance 2.0 和快手可灵 3.0 登顶,讨论发酵数日后才被阿里确认来自 ATH 创新团队。

这一模式的逻辑并不复杂。大模型出海要争取的不只是新闻曝光,更是进入开发者的日常工作。对大多数中国团队而言,海外社区仍停留在「听过但没用过」的阶段——直接挂名发布,开发者未必愿意专门去试;一个神秘代号加上免费、长上下文、Agent 等关键词,更容易触发点击与试用。

平台的选择也颇为讲究。HappyHorse 选择的是视频模型盲测榜单,排名变化本身就会形成话题;Ox Alpha 落地的 OpenRouter 是开发者选模型、比价格的入口,而 OpenCode 直接连接编程 Agent。用户无需更换工具或重新学习工作流,仅切换模型即可让 Agent 开始读代码、跑任务。

开发者双重角色:一边测能力,一边验明正身

Ox Alpha 上线后,社区迅速分化为两种声音。乐观一方的依据来自一组 DeepSWE 测试:在 10 个软件工程任务中,Ox Alpha 通过约 8 个,成绩高于同场多款知名模型。然而样本过小也成为质疑焦点——每增减一道题,分数波动达 10 个百分点;后续更大样本的社区复测结果回落至约 63%,且并非官方审计榜单。

在更偏抽象推理的 INDUCTION 基准上,Ox Alpha 的表现则落后于 GPT-5.6 Luna 和 DeepSeek V4 Pro,仅略高于 Gemini 3.7 Flash。研究者 Serafim Batzoglou 为获得 87 个可评估结果,调用了 551 次 API,期间频繁遭遇空回答和接口错误;他本人也无法判断问题主要来自模型本身,还是 OpenRouter 的接入链路。

与此同时,开发者社区正在通过技术手段「验明正身」。他们分析 token 切分方式、错误参数返回提示、temperature 为 0 时的输出组织方式,甚至中文提示词下的语言习惯。目前最主流的猜测指向智谱 Z.ai 的 GLM-5.x 系列:tokenizer、推理档位报错与部分条件下的输出风格均与 GLM-5.3 接近,而 Ox Alpha 的多模态能力又暗示它可能是尚未公开的多模态变体。

这个过程说明,匿名模型上线后,社区会自发承担后续工作——有人跑测试、有人拆参数、有人翻报错、有人顺着 token 计数一路追溯模型归属。开发者实际上同时扮演了公测用户、媒体、分析师和测试工程师四种角色。

匿名带来真实反馈,也把判断成本留给了用户

匿名发布的核心价值在于剥离品牌滤镜。当模型不挂任何公司名时,开发者看到的是结果本身:代码质量、工具调用、长任务稳定性、性价比。OpenRouter 联合创始人 Alex Atallah 此前回顾 Quasar Alpha 时表示,平台与模型团队希望观察用户在不知道开发者的情况下如何选择和使用,从而减少品牌预设,更快拿到真实反馈。

免费期收集到的使用数据,对模型定位、定价策略和能力优先级也有直接参考价值——对尚未明确产品形态的新模型而言,这比提前准备一套发布会话术更实用。

但这场「盲测」并不完全对等。厂商和平台掌握模型的真实归属、服务部署位置以及记录哪些信息;用户拿到的往往只有一个代号与一段有限说明。Reddit 上有开发者指出,匿名模型难以进入企业评估流程:内部 benchmark、代码与业务数据均涉及合规,审批走完,模型可能已经下线。

Ox Alpha 将这一矛盾进一步放大。OpenRouter 页面写明提示词与输出会由上游提供方保留但不用于训练,而 OpenCode 相关说明则强调零数据留存——两种说法并不完全一致。对只是试玩的个人开发者,这或许只是条款差异;对准备上传代码和业务文档的团队而言,则直接关系到能否接入。

另一个容易被忽略的层面是:真实公测检验的从来不只是模型能力。Serafim Batzoglou 在 INDUCTION 测试中遭遇的大量空回答与 API 错误,让「问题出在模型还是接入链路」成为开放议题。但对最终用户而言,模型能否稳定工作本就是产品能力的一部分。

匿名发布确实为模型赢得了摆脱品牌滤镜的机会,也让厂商更早触及真实反馈;但用户在收获免费惊喜的同时,也承担了更多判断成本——自主识别身份、评估能力、核对数据政策,并面对潜在的服务不稳定。


来源:本文综合自极客公园(geekpark),作者连冉,经 36 氪授权发布。

信源