桃子桃子快讯
返回首页
模型发布

智谱开源 GLM-5.3-Flash:320B 多模态模型

智谱 Z.ai 开源 GLM-5.3-Flash,320B 原生多模态 MoE 模型,首次公开 glm5_next 架构…

2026.08.26 · 周三4 分钟阅读

智谱 Z.ai 近日开源了 GLM-5.3-Flash 模型,这是 GLM-5 系列中首个原生多模态模型,也是 glm5_next 架构首次以开放权重形式发布。官方表示,该模型在编码与智能体类基准上接近 Claude Opus 4.8,定价仅为上一代 GLM-5.2 的十分之一。模型已在 Hugging Face、ModelScope 及 GitHub 上线,权重分别提供 FP8 与 BF16 两个版本。

核心架构

GLM-5.3-Flash 总参数 320B,单次推理激活 18B,采用 MoE 架构(288 个路由专家 + 1 个共享专家,单次激活 8 路由 + 1 共享)。在注意力机制上做了显著创新:

  • 45 层结构由 3 层密集 MLP + 42 层 MoE 组成;
  • 注意力层采用「3 层 KDA 线性注意力 + 1 层 DeepSeek 风格稀疏注意力」的循环块布局,共 34 层线性 + 11 层稀疏;
  • 稀疏层配备 lightning indexer(32 头,维度 128),top-k 预算 2048 tokens,可大幅降低长上下文推理成本;
  • 引入 Manifold-Constrained Hyper-Connections(mHC),在层间使用流形约束的残差流混合以提升扩展效率。

模型词表 154,880,理论上下文长度 1,048,576 tokens,官方评估使用 300K 文本 / 164K 视觉上下文。

原生多模态能力

GLM-5.3-Flash 配备 24 层 ViT 视觉编码器,图像输入 448×448、patch 尺寸 14,2×2 空间合并;视频支持 2 帧时间 patch。视觉与文本 token 统一进入模型词表,实现真正的原生多模态处理,模型在 30T token 的多模态语料上完成预训练。权重中内置 1 层 MTP(Multi-Token Prediction)头,官方 vLLM 推理方案启用 5 个投机 token 以加速生成。

部署与推理

主仓库以 FP8(e4m3,动态激活缩放)发布,约 331 GB(62 分片);另提供 BF16 版本约 640 GB(120 分片)。

  • vLLM:官方适配 v0.27.0+,FlashInfer 0.6.17+(NoPE 稀疏 MLA,Hopper 及更新架构),推荐 TP=4;
  • SGLang:已验证 H100/H200/B200/B300/GB200/GB300(TP4/EP4),支持自适应 MTP;
  • 同步上线:TokenSpeed、KTransformers(CPU/GPU 混合方案)。

采样参数方面,默认 temperature=1.0、top_p=0.95;智能体编码(NL2Repo)使用 top_p=1.0,DeepSWE 使用 temperature=0.95、top_p=1.0。

生态与资源

  • Hugging Face:zai-org/GLM-5.3-Flash(含 FP8 与 BF16 双版本)
  • ModelScope:ZhipuAI/GLM-5.3-Flash
  • 代码仓库:github.com/zai-org/GLM-5
  • 技术论文:arxiv.org/abs/2602.15763
  • 第三方量化:Unsloth 提供 GGUF 与 FP8 版本,AtomicChat 提供 GGUF 版本
信源