智谱 GLM-5.3 Flash 开源:首个原生多模态,320B 参数对标 Claude Opus 4.8
智谱发布并开源 GLM-5.3 Flash,5 系列首个原生多模态模型,AA 榜 57 分追平 Claude Opus…
近日在网上以「牛来(Ox Alpha)」名义匿名走红的神秘模型,终于被智谱正式认领——它就是 GLM-5.3 Flash,GLM 5 系列首个原生多模态模型,现已面向全球开源。在 OpenRouter 与 OpenCode 上匿名运行期间,Ox Alpha 一举刷新了单日 tokens 用量纪录,并终结了 DeepSeek 在 OpenCode 连续 56 天的霸榜;更引人注目的是,承接这波全球真实流量的算力,全部来自国产芯片。
核心能力:原生多模态 + 长上下文
GLM-5.3 Flash 是智谱 5 系列中首个原生多模态模型,不再依赖外挂视觉模块,而是从预训练阶段就将视觉与语言统一建模。结合 30T Token 多模态预训练语料与面向 Visual Coding 的数据合成流水线,模型在执行任务过程中可以自主查看最终页面、交互和 3D 场景,再依据视觉反馈继续修改。上下文长度支持到 1M,配合注意力机制的改造,长任务场景下不会出现明显的「轻量版」折损感。
实测表现
- 多人说话视频分人配字幕:能精准捕捉画面中只出现一次的名签,将声音、人物、名字三者对齐。
- 电影解说:输入完整电影后,可自行完成剧情梳理、关键片段剪辑、配音与字幕生成。
- UI 设计稿还原:依据一张设计稿实现完整移动端购物 App,包含首页、商品、购物车、支付、门店地图等可交互页面。
- 3D Blender 场景构建:官方展示了一次连续运行 12 小时的复杂 3D 场景构建任务,由模型独立跑通。
架构:混合注意力 + 极致瘦身
GLM-5.3 Flash 总参数 320B,实际激活仅 18B,层数也从 GLM-4.5 时期的 92 层压缩到 45 层,能力反而超过 753B 的上一代 GLM-5.2。
- 注意力机制:采用线性注意力 + 稀疏注意力的混合架构。线性注意力负责局部信息,稀疏注意力通过轻量级索引器召回真正相关的全局上下文。
- IndexPool:把索引器原本 4 个缓存向量压缩为 1 个。
- 效率收益:相比 GLM-5.3,注意力计算量降低 3.01 倍,KV Cache 缩小 4.44 倍。
在推理栈层面,智谱将多模态编码、Prompt 预填充与逐 Token 解码拆成可独立调度的 Encode-Prefill-Decode 分离式架构,并叠加 Layer Split、混合缓存量化等优化。同一套国产硬件上,端到端服务性能提升 3 倍,单 Token 成本做到与主流英伟达 GPU 相当。
Benchmark 与定价
- AA 榜单:57 分,与 Claude Opus 4.8 持平,进入全球前沿梯队。
- 定价:GLM-5.3 Flash 定价为 GLM-5.3 的 1/10,限时折扣可达 1/20 的 GLM-5.3、1/40 的 Opus 4.8,且低于 DS-V4-Flash。
开源与生态
GLM-5.3 Flash 已在 HuggingFace 开源权重(zai-org/GLM-5.3-Flash 及 BF16 版本),同步接入 ZCode 并开放 API,开发者可直接下载部署。智谱表示,模型、国产算力、开源生态三者首次在同一个发布节点上完整对齐。
参考链接:
- 智谱 Blog:https://z.ai/blog/glm-5.3-flash
- HuggingFace 开源:https://huggingface.co/zai-org/GLM-5.3-Flash
- BigModel 开放平台文档:https://docs.bigmodel.cn/cn/guide/models/vlm/glm-5.3-flash
