智谱确认 Ox Alpha 为 GLM-5.3-Flash,开源权重已上线
智谱揭晓匿名模型 Ox Alpha 真实身份为 GLM-5.3-Flash:320B 总参数 MoE、原生多模态、百万…
智谱正式确认,过去一周在 OpenRouter 上以匿名身份引爆海外开发者社区的神秘模型 Ox Alpha,正是其最新发布的 GLM-5.3-Flash。在身份揭晓前,这款模型凭借代码生成、复杂推理和长时间 Agent 任务中的表现迅速冲上 OpenRouter 热门榜单,Stripe 联合创始人 Patrick Collison 也公开评价其「非常令人印象深刻」。
模型基本架构:320B 总参数,仅激活 18B
GLM-5.3-Flash 是一款混合专家(MoE)模型,总参数规模为 3200 亿,但每次处理 Token 时仅激活约 180 亿参数。与 GLM-4.5 系列相比(总参 3550 亿、激活 320 亿、92 层),GLM-5.3-Flash 将激活参数压缩至 180 亿,模型层数减少至 45 层。激活参数和层数的缩减直接降低了单 Token 推理所需计算量,这也是「Flash」名称的来源:通过架构变化而非简单缩小模型,用更少计算量保留接近大型模型的能力。
该模型还是 GLM-5 系列中首款原生多模态模型,可同时处理文本、图片、视频和文件,并提供约 100 万 Token 上下文窗口。智谱称其采用了最新的 30 万亿 Token 多模态预训练语料,视觉能力在预训练阶段便与文本统一建模,而非后期外挂。模型权重已通过 Hugging Face 开源,采用 MIT 许可证,开发者可通过 SGLang、vLLM、KTransformers 和 TokenSpeed 等框架本地部署。
关键技术亮点:混合注意力与代码 Agent 能力
为百万 Token 重设计的注意力机制
GLM-5.3-Flash 采用线性注意力与稀疏注意力结合的混合架构,智谱称其为首个采用此类混合架构的开源前沿模型。其中线性注意力通过状态建模捕捉局部依赖,稀疏注意力则通过轻量级索引器从更长上下文中检索相关信息。为进一步压缩索引器开销,智谱设计了 IndexPool,通过加权池化将四个索引器 Key 向量压缩为一个。
按官方测算,相较 GLM-5.3,注意力计算量降至约三分之一,KV Cache 规模降至约四分之一(分别减少 3.01 倍和 4.44 倍)。不过在与 DeepSeek-V4-Flash 和 Kimi-K3 的对比中,GLM-5.3-Flash 的 KV Cache 仍略大于上述两者,显存效率尚有优化空间。此外,模型还引入了 Manifold-Constrained Hyper-Connections(mHC)以提升训练稳定性。
代码与 Agent 能力为主打长板
在多项代码和 Agent 基准测试中,GLM-5.3-Flash 较前代有明显提升:
- DeepSWE v1.1:63.4(GLM-5.2 为 46.2)
- AutomationBench:48.8(GLM-5.2 为 26.2)
- NL2Repo:56.3
- Toolathlon Verified:78.4
- Agents' Last Exam:26.3
- Terminal-Bench 2.1:84.3
Terminal-Bench 2.1 测试允许模型最长运行 6 小时、最大生成长度 65536 Token,更接近真实 Coding Agent 的连续思考与操作模式。在智谱内部的 Z.ai Code Bench v1.0 最高推理强度下,GLM-5.3-Flash 取得 29.0 分,接近 Claude Opus 4.8 的 29.5 分。第三方机构 Artificial Analysis 则给出综合智能指数 57 分,优惠价格口径下每项任务成本约 0.045 美元。
视觉能力进入代码执行闭环
GLM-5.3-Flash 将视觉理解纳入代码与 Agent 执行链路,形成「观察—实现—使用—修正」闭环:模型先读取截图、设计稿或软件界面,生成代码并运行,再观察渲染结果与参考画面比较并修改。为此智谱构建了面向视觉编码的数据合成流程,并在前端场景引入基于真实用户流程的 Agent 验证强化学习。该能力可覆盖前端页面复刻、游戏开发、Blender 3D 场景、CAD 建模以及 Computer Use 等任务。
全部测试流量跑在国产芯片上
GLM-5.3-Flash 官方博客披露,Ox Alpha 匿名测试期间的全部推理流量均运行在国产 AI 芯片集群上。智谱基于 SGLang 为该模型开发了专用推理引擎,包含 ReplaySSM、W8A8 量化、INT8/FP8/BF16 混合 KV Cache 量化、Layer Split 等优化。在集群层面采用 Encode—Prefill—Decode 分离架构,将多模态编码、提示词预填充与逐 Token 解码拆分为独立调度的工作池。
按照官方说法,这套系统已运行在数万颗国产加速芯片之上。相较最初在同一硬件上的基线版本,端到端推理性能提升了 3 倍,每 Token 成本和硬件效率达到与主流英伟达 GPU 相当的水平。
实测体验:逻辑推理可用,但日程规划偏紧
在实际测试中,GLM-5.3-Flash 在经典逻辑题(三个标签全错的盒子问题)上仅用 13 秒、消耗 2303 Token 即给出正确解答。但在「上海出差三日日程」规划任务中,模型虽识别出航班晚点风险并建议提前抵沪,整体排程却未预留通勤与休整时间,衔接偏紧凑。
综合来看,GLM-5.3-Flash 在代码与 Agent 方向的能力提升有明确基准支撑,混合注意力架构与国产芯片全栈部署也是其差异化亮点。匿名测试积累的真实负载反馈,配合后续开源释放的技术细节,为开发者评估该模型提供了较完整的参考信息。
