智谱开源 GLM-5.3-Flash:320B 多模态模型
智谱 Z.ai 开源 GLM-5.3-Flash,320B 原生多模态 MoE 模型,首次公开 glm5_next 架构…
智谱 Z.ai 近日开源了 GLM-5.3-Flash 模型,这是 GLM-5 系列中首个原生多模态模型,也是 glm5_next 架构首次以开放权重形式发布。官方表示,该模型在编码与智能体类基准上接近 Claude Opus 4.8,定价仅为上一代 GLM-5.2 的十分之一。模型已在 Hugging Face、ModelScope 及 GitHub 上线,权重分别提供 FP8 与 BF16 两个版本。
核心架构
GLM-5.3-Flash 总参数 320B,单次推理激活 18B,采用 MoE 架构(288 个路由专家 + 1 个共享专家,单次激活 8 路由 + 1 共享)。在注意力机制上做了显著创新:
- 45 层结构由 3 层密集 MLP + 42 层 MoE 组成;
- 注意力层采用「3 层 KDA 线性注意力 + 1 层 DeepSeek 风格稀疏注意力」的循环块布局,共 34 层线性 + 11 层稀疏;
- 稀疏层配备 lightning indexer(32 头,维度 128),top-k 预算 2048 tokens,可大幅降低长上下文推理成本;
- 引入 Manifold-Constrained Hyper-Connections(mHC),在层间使用流形约束的残差流混合以提升扩展效率。
模型词表 154,880,理论上下文长度 1,048,576 tokens,官方评估使用 300K 文本 / 164K 视觉上下文。
原生多模态能力
GLM-5.3-Flash 配备 24 层 ViT 视觉编码器,图像输入 448×448、patch 尺寸 14,2×2 空间合并;视频支持 2 帧时间 patch。视觉与文本 token 统一进入模型词表,实现真正的原生多模态处理,模型在 30T token 的多模态语料上完成预训练。权重中内置 1 层 MTP(Multi-Token Prediction)头,官方 vLLM 推理方案启用 5 个投机 token 以加速生成。
部署与推理
主仓库以 FP8(e4m3,动态激活缩放)发布,约 331 GB(62 分片);另提供 BF16 版本约 640 GB(120 分片)。
- vLLM:官方适配 v0.27.0+,FlashInfer 0.6.17+(NoPE 稀疏 MLA,Hopper 及更新架构),推荐 TP=4;
- SGLang:已验证 H100/H200/B200/B300/GB200/GB300(TP4/EP4),支持自适应 MTP;
- 同步上线:TokenSpeed、KTransformers(CPU/GPU 混合方案)。
采样参数方面,默认 temperature=1.0、top_p=0.95;智能体编码(NL2Repo)使用 top_p=1.0,DeepSWE 使用 temperature=0.95、top_p=1.0。
生态与资源
- Hugging Face:zai-org/GLM-5.3-Flash(含 FP8 与 BF16 双版本)
- ModelScope:ZhipuAI/GLM-5.3-Flash
- 代码仓库:github.com/zai-org/GLM-5
- 技术论文:arxiv.org/abs/2602.15763
- 第三方量化:Unsloth 提供 GGUF 与 FP8 版本,AtomicChat 提供 GGUF 版本
