桃子桃子快讯
返回首页
开源

智谱开源 GLM-5.3-Flash:320B 多模态 MoE 模型

智谱(Z.ai)发布 GLM-5.3-Flash,320B 参数(激活 18B)原生多模态开源模型,主打混合稀疏+线性注…

2026.08.26 · 周三5 分钟阅读

智谱(Z.ai)正式开源 GLM-5.3-Flash 模型权重,这也是 GLM-5 系列中首个原生多模态版本与 glm5_next 架构的首次开源。官方定位为:以约前代十分之一的价格,能力超越 GLM-5.2,并在编码与智能体(agentic)基准上接近 Claude Opus 4.8。模型已在 Hugging Face、ModelScope 提供 FP8 与 BF16 两种权重版本。

核心亮点

GLM-5.3-Flash 在架构上做了多项重要改动:

  • 混合稀疏 + 线性注意力:45 层由「3 层 KDA 线性注意力 + 1 层 DeepSeek 风格稀疏注意力」重复构成,共 34 层线性 + 11 层稀疏。
  • 闪电索引器(lightning indexer):稀疏层配有 32 头、128 维索引器,top-k 预算 2048 个 token,用于显著降低长上下文推理成本。
  • 流形约束超连接(mHC):加宽残差流并在层间做流形约束混合,提升扩展效率。
  • 原生多模态:24 层 ViT(448×448,patch 14,2×2 空间合并 + 时间 patch),图像与视频 token 进入词表,训练语料达 30T token。
  • MTP 头随权重发布:1 层 next-N 预测,官方 vLLM 配方配合 5 个推测 token 使用。
  • FP8 优先:主仓库为 FP8(e4m3,动态激活缩放),另设独立 BF16 仓库。

架构与规模

模型整体规模与配置如下:

  • 类型:带视觉编码器的因果语言模型(Glm5NextForConditionalGeneration),预训练 + 后训练两阶段。
  • 总参数 320B,激活 18B;隐藏维度 4096,词表 154,880。
  • 层数 45:前 3 层为稠密 MLP,其余 42 层为 MoE;布局为 11 × (3 × (KDA 线性注意力 → MoE) → 1 × (稀疏注意力 → MoE)),末尾追加 1 个线性层。
  • 专家:288 路由 + 1 共享,激活 8 路由 + 1 共享,专家中间维度 2048;前 3 层稠密中间维度 12288。
  • KDA 线性注意力:34 层,64 头,头维度 128。
  • 稀疏注意力:11 层(DeepSeek 风格),64 头,QK/V 头维度 256/256,索引器 top-2048。
  • 上下文长度:1,048,576 token(max_position_embeddings),评测时文本 300K、视觉 164K。

视觉编码器为 24 层 ViT,隐藏维度 1024、16 头,输出投影至 LM 隐藏维度 4096。FP8 权重约 331 GB(62 分片),BF16 约 640 GB(120 分片)。

基准与采样参数

模型卡与官方仓库列出了主要基准图表(社区帖中已附图)以及推荐采样参数:

  • 默认:temperature=1.0,top_p=0.95,评测最大生成长度 163,840。
  • 智能体编码(NL2Repo):temperature=1.0,top_p=1.0。
  • DeepSWE:temperature=0.95,top_p=1.0。
  • 视觉(BabyVision):temperature=1.0,top_p=0.95。

推理部署

官方推荐 vLLM 0.27.0+ 配合 FlashInfer 0.6.17+(用于 NoPE 稀疏 MLA,需 Hopper 及更新架构),示例命令使用 TP=4、KV 缓存 FP8、MTP 推测解码 5 个 token。SGLang 官方 cookbook 覆盖 H100/H200/B200/B300/GB200/GB300(TP4/EP4),并提供自适应 MTP 与 --mm-feature-transport cpu 视觉特征卸载方案。

发布首日同时支持 TokenSpeed 与 KTransformers(含 CPU/GPU 混合推理教程)。社区已出现 Unsloth 与 AtomicChat 提供的 GGUF/FP8 量化版本。

官方与社区资源

  • Hugging Face(FP8 / BF16)、ModelScope 模型库与 GitHub 仓库均已上线。
  • 官方博客、文档、论文(arXiv:2602.15763)以及 vLLM recipes、SGLang cookbook 同步发布。
  • 社区聚合贴将在后续讨论中集中收录量化、聊天模板、消融变体与服务端配置等分支话题。
信源