智谱 GLM-5.3-Flash 正式发布:320B 参数主打极致性价比
智谱发布 GLM-5.3-Flash 原生多模态模型,AA 智能指数 57 分超越 DeepSeek V4 Pro,定价…
智谱 AI 正式发布 GLM 系列首个原生多模态模型 GLM-5.3-Flash,揭开此前在 OpenRouter 上匿名走红的「Ox Alpha」模型面纱。在 Artificial Analysis Intelligence Index 上,GLM-5.3-Flash 拿下 57 分,高于 DeepSeek V4 Pro 正式版的 53 分;官方称在部分口径上可对标 Claude Opus 4.8。该模型支持文本、图片、视频输入与文本输出,上下文长度达 104 万 Token。
价格策略:直接把对手逼到墙角
GLM-5.3-Flash 公布的标准定价为每百万 Token 缓存未命中输入 0.8 元、输出 2.8 元,相当于 GLM-5.3 的十分之一。上线后还推出两周限时半价优惠,输入 0.4 元、输出 1.4 元,缓存命中输入 0.115 元,优惠持续至 2026 年 9 月 9 日 24 时。
这一定价的时机颇具针对性。8 月 17 日 DeepSeek 新版定价生效后,V4 Pro 高峰时段涨幅最高达 1100%,V4 Flash 峰时输出价格从 0.28 美元涨至 1.32 美元(4.71 倍)。涨价后,DeepSeek 日 Token 用量跌至峰值一半以下,OpenCode CEO 估算平台因此空出近 10 万亿 Token 日需求,GLM-5.3-Flash 迅速承接了这部分流量。
不过,文章指出在 Agent 频繁调用的场景下,缓存命中价格才是账单大头。以一次累计输入 50 万 Token(99% 命中缓存)、输出 1 万 Token 的任务为例:优惠结束后用 GLM-5.3-Flash 约 0.146 元,而 DeepSeek V4 Flash 谷时仅约 0.077 元、峰时约 0.155 元。也就是说,GLM 砍过了「梁文峰」,却未必砍得过「梁文谷」。
模型架构:大块头,小胃口
GLM-5.3-Flash 拥有 3200 亿总参数,但每 Token 仅激活约 180 亿参数,占比仅 5.6%。面对 104 万 Token 超长上下文,模型将线性注意力与稀疏注意力结合,降低处理历史信息的计算开销。这种 MoE 式稀疏激活设计,让模型在体量与实际算力消耗之间拉开距离,也是智谱敢于让 Ox Alpha 匿名期间全免费试用的底气所在。
Ox Alpha 匿名上线不到一天,便同时登顶 OpenRouter 与 OpenRouter 调用量榜,创下 OpenRouter 模型发布纪录,终结 DeepSeek 连续 56 天霸榜。Hermes Agent 创始人发文感叹:该模型正在「屠杀」所有内部基准。
国产算力:10 万张卡扛住全球流量
Ox Alpha 匿名期间单日处理量一度达约 62 万亿 Token,线上流量全部由 10 万张国产芯片承载,芯片来源据报道可能包括华为、摩尔线程和海光。针对国产芯片内存容量与带宽瓶颈,智谱在 SGLang 基础上搭建专用推理引擎,将多模态编码、提示词预填充与逐 Token 解码拆分调度,并配合量化、并行与内存优化。智谱还用自研 Infra Agent 协助算子开发与瓶颈诊断,形成「模型优化系统、系统承载模型」的闭环。
官方称,与同一批硬件的初始基线相比,端到端服务性能提升 3 倍,硬件效率与单 Token 成本已达到主流英伟达 GPU 水平。SemiAnalysis 也评价英伟达护城河再次受到考验。不过,这一成本结论目前主要来自智谱自身测算,尚未经过第三方独立验证。
市场格局:从性价比之争到生态之争
智谱此次出击,目标正是 DeepSeek 最核心的「性价比」标签。从表面价格看,GLM-5.3-Flash 在缓存未命中输入输出维度确实全面低于 DeepSeek;但在高缓存命中的 Agent 任务中,缓存成本的劣势会抵消部分价格优势。更深层的影响在于,GLM-5.3-Flash 不只是一款低价模型,还跑在一套被全球真实流量压过的国产算力方案之上。对于 DeepSeek 而言,这种「模型 + 国产算力」的组合,可能比单纯的价格竞争更难应对。
