桃子桃子快讯
返回首页
模型发布

智谱开源 GLM-5.3-Flash,320B 多模态模型对标 Claude Opus 4.8

智谱上线并开源 GLM-5.3-Flash 原生多模态模型,AA 指数 57 与 Claude Opus 4.8 持平,…

2026.08.28 · 周五3 分钟阅读

8 月 26 日晚,智谱正式上线并开源 GLM-5.3-Flash(320B-A18B),这是 GLM-5 系列的第一个原生多模态模型,总参数 320B,能力超过上一代 GLM-5.2。在全球权威的 Artificial Analysis Intelligence Index(AA 综合智能指数)中,该模型取得 57 分,进入全球前沿模型能力区间,与 Anthropic 旗下 Claude Opus 4.8 得分持平。

模型架构与训练数据

GLM-5.3-Flash 采用 MoE 架构(320B 总参数、A18B 激活参数),专为极低推理成本设计。其训练基于智谱最新的 30T Token 多模态预训练语料,旨在以更少的计算资源实现更强的性能表现。

正式发布前,模型以匿名身份 Ox-Alpha(中文社区称「牛来」)在 OpenCode 和 OpenRouter 上进行大规模测试,期间 Token 调用量高达 62T,这些请求流量全部由国产芯片提供算力支持。

商汤大装置的国产算力支撑

商汤大装置为 GLM-5.3-Flash 的上线提供了大规模国产算力支持与 Token 服务。其核心能力体系围绕「一套模型、一座 Token 工厂、一套智能体管控系统」构建,其中 Token 工厂通过多模态模型与基础设施的联合优化,组织不同芯片、集群、能源和交付节点,持续生产高质量、低成本 Token,并与大模型形成双向反哺闭环。

实际表现方面,商汤大装置披露了以下关键数据:

  • 相较同一硬件环境下的初始基线,GLM-5.3-Flash 在国产芯片集群上端到端服务性能提升 3 倍
  • 硬件效率与单 Token 成本已达到与主流英伟达 GPU 相当的水平
  • 整体推理性价达到 NVIDIA H 系列的 1.25 倍
  • 相比国产同构推理,同等成本下 Token 产能扩大约 2.5 倍

国产算力走向规模化商用

商汤大装置围绕「性价比、适配性、能效比」三个维度系统性破题国产算力商用卡点:在适配性上,通过底层算子优化、多卡并行调优和工具链适配降低应用门槛;在能效比上,推出算电协同 Agent,并提出以 TPW(Tokens Per Watt)作为 AIDC 的价值标尺。

据商汤披露,其 Token Factory 在 2026 年 7 月日均 Token 服务量已达 2.42 万亿,预计当年年底突破日均 10 万亿,全年 Token 量级增长约 25 倍。这表明国产算力正从「单点可用」迈向「大规模商用」,具备支撑前沿大模型推理的经济性与工程能力。

信源