桃子桃子快讯
返回首页
开源

千问智谱连夜开源,国产大模型价格战再升级

阿里千问与智谱同日开源预览版模型,性能对标头部闭源产品,API 价格较主流对手低三分之一。

2026.08.27 · 周四6 分钟阅读

阿里千问大模型团队与智谱于 8 月 27 日凌晨先后开源了各自的下一代预览模型:千问发布了基于 Qwen4 架构打造的实验预览版 Qwen3.8‑Flash‑Next,智谱则上线了 GLM‑5 系列首个原生多模态模型 GLM‑5.3‑Flash(即此前网络上流传的匿名模型 Ox‑Alpha「牛来」)。两款模型均以「高性能 + 低价格」组合拳对标头部闭源与开源竞品,并在基准测试中正面挑战 DeepSeek‑V4‑Flash 与 Claude Opus 系列。

千问 Qwen3.8‑Flash‑Next:Qwen4 架构预览与基准表现

Qwen3.8‑Flash‑Next 主模型参数量为 125B,额外配备 51B 的 N‑gram Embedding,每 token 激活 6B 参数,原生支持 262144 token 上下文,可通过 YaRN 扩展至 1 百万 token。千问团队表示,相比上一代 Qwen3.7‑Plus,新模型训练开销仅约前者的 1/9,但在编程和办公任务上性能更强。

在千问公布的基准测试中,Qwen3.8‑Flash‑Next 在绝大多数项目上超过 Qwen3.8‑27B、Qwen3.7‑Plus、DeepSeek‑V4‑Flash‑0731 以及 Claude‑Opus‑4.6(Max):

  • 纯文本能力:10 项任务中拿下第一,涵盖智能体编程 DeepSWE1.1、SWE‑bench Pro 多语言软件工程等,仅在仓库级代码生成 Repo‑level code generation 上略逊于 DeepSeek。
  • 智能体能力:长周期办公、专业工作、前沿智能体加权得分以及真实工具调用测试中均居首位。
  • 通用能力:指令遵循、科学推理、竞赛代码三项第一,仅在多学科综合推理上略弱于 Claude‑Opus‑4.6。
  • 多模态能力:13 项任务全部超过上述三个对比模型,包括看图理解、长视频、图表与数学等。

四大架构创新:GDN+QSA、门控残差、N‑gram Embedding 与 Muon 优化

千问围绕 Attention、Residual、Embedding 与 Optimization 四个维度对模型进行了系统升级:

  • GDN + QSA 混合注意力:沿用 Qwen3.5 的混合架构,每四层中三层使用 Gated DeltaNet 持续压缩历史信息,第四层保留全局 Attention;并在全局层引入 Qwen Sparse Attention(QSA),以微块粒度筛选重要上下文。在 1M token 上,QSA 的 Attention Kernel 在 Prefill 与 Decode 阶段分别实现最高 7.6 倍和 4.9 倍加速;在 90% Prefix Cache 命中设定下,1M 上下文 Prefill 吞吐达到 Qwen3.7‑Plus 的 8.6 倍。
  • Gated Residual(GR)门控残差:将单一 residual stream 扩展为 4 条并行分支,由门控机制动态决定读写比例,并把分支混合简化为 4 条独立通道,同时归一化后的 Gate 抑制激活异常值,残差状态支持 FP8 存储。
  • N‑gram Embedding:受 Gemma 3n 的 Per‑Layer Embedding 与 DeepSeek Engram 等工作启发,结合当前 token 与前若干 token 的局部上下文查表,额外引入 51B 参数,存放在 Host Memory 中通过异步预取与计算重叠,几乎不增加每 token 计算量。
  • Muon 优化器工程化:对 Attention、GDN 与 MoE 专家主权重使用 Muon,其余参数继续使用 AdamW;重新拟合 Scaling Law 后可直接从目标 Batch Size 开始训练,省去 18.8% 的 Batch Warmup 步骤。

价格战升级:API 定价低至对手三分之一

在定价层面,两款新模型均显著低于市场主流水平:

  • Qwen3.8‑Flash 在千问 AI 平台以 qwen3.8‑flash 提供服务,每百万 Tokens 输入 1 元、输出 3 元;相比空闲时段 DeepSeek‑V4‑Flash,输入与输出价格均低 33.33%。平台兼容 OpenAI Chat Completions、Responses API 与 Anthropic 接口,可直接对接 Claude Code 与 Codex。
  • GLM‑5.3‑Flash 总参数 320B(激活约 18B),在智谱自研 Z.ai Code Bench 体感评估中编程表现与 Claude Opus 4.8 相当,价格降至 GLM‑5.3 的 1/10(限时折扣期内为 1/20),相当于 Opus 4.8 的 1/40。

社区先行:千问主动开放下一代架构预览

千问团队在博客中提到,提前释出架构改动是为了在发布 Qwen4 完整家族前先让社区进行检验。模型权重已同步上线 Hugging Face 与 ModelScope,默认支持 1M 上下文并内置官方工具的生产版本,技术报告同步发布在 GitHub 仓库。Twitter 评论区中,多位海外开发者表达了对新模型的期待。

行业层面看,企业对长文档处理、私有化部署与 Agent 智能体等高价值场景的需求正快速规模化,冷输入成本、推理带宽开销与硬件适配能力等工程化指标的权重持续上升。千问与智谱此次同步开源并大幅降价,意味着国产大模型的竞争焦点已从单纯的参数规模,转向架构效率与单位算力性价比。

信源