桃子桃子快讯
返回首页
模型发布

智谱发布 GLM-5.3 Flash:原生多模态 MoE,320B 参数 1M 上下文

智谱推出 GLM-5 系列首款原生多模态模型 GLM-5.3 Flash,320B 总参数 / 18B 激活,1M 上下…

2026.08.28 · 周五2 分钟阅读

智谱(Zai_org)旗下 GLM-5.3 Flash 模型近日上线,由 Together AI 在 X 平台公布关键规格与基准表现。作为 GLM-5 系列首款原生多模态模型,GLM-5.3 Flash 面向长上下文与高吞吐场景,主打软件工程类代理任务。

模型规格与架构

GLM-5.3 Flash 采用 MoE(混合专家)架构,总参数规模 320B,每次推理激活 18B 参数,兼顾大模型能力与推理成本。

关键参数一览:

  • 总参数:320B;激活参数:18B
  • 上下文长度:1M token
  • 注意力机制:混合注意力(hybrid attention)
  • 模态支持:原生多模态,为 GLM-5 系列首次

混合注意力机制通常结合全局注意力与局部/滑动窗口注意力,有助于在 1M 超长上下文下控制显存与计算开销。原生多模态意味着模型在预训练阶段即同时处理文本与其他模态,而非后期拼接。

基准表现与效率

Together AI 给出的对比数据来自 DeepSWE——一个面向软件工程代理(SWE-Agent)的基准测试。

主要结论:

  • 在 DeepSWE 上,GLM-5.3 Flash 的得分接近 Together AI 所述参考模型 Luna
  • 在相同预算下,GLM-5.3 Flash 完成的工作量达到 Luna 的两倍以上

该表述侧重单位成本下的产出(throughput-per-dollar),而非绝对跑分领先。对于需要在大量代码任务中部署代理的企业而言,成本效率是比单次基准峰值更关键的指标。

部署与可用性

GLM-5.3 Flash 通过 Together AI 平台提供接入,意味着开发者可直接调用 API 而无需自行部署 320B 级别的模型。GLM 系列过往权重多以开源或开放权重形式发布,本次是否同步开放权重,Together AI 的通告中未明确披露,需以智谱官方渠道为准。

考虑到 1M 上下文与多模态能力的组合,GLM-5.3 Flash 的主要应用场景预计包括:长代码库理解与重构、多文档 Agent 任务、跨模态信息抽取与总结,以及需要高吞吐 API 调用的生产环境。

信源