工具
Qwen 新架构获 TokenSpeed 首发支持
通义千问宣布 TokenSpeed 已对其新架构实现 day-0 支持,覆盖 GDN、QSA、N-gram embedd…
2026.08.27 · 周四约 2 分钟阅读
通义千问(Qwen)官方在 X 平台发文宣布,第三方推理加速框架 TokenSpeed 已对其全新模型架构提供 day-0 级别支持,覆盖从 GDN + QSA 到 N-gram embedding 与 FP8 量化等多项关键技术。
公告提及的核心架构特性
根据 Qwen 官方账号发布的信息,TokenSpeed 的支持范围涵盖新架构的几个关键组件:
- GDN:疑似 Gated DeltaNet 一类的线性注意力或门控机制;
- QSA:可能与查询共享注意力或某种结构化注意力变体相关;
- N-gram embedding:在 embedding 层引入 N-gram 特征,以增强模型对局部模式的捕获;
- FP8:8 位浮点量化,用于降低显存占用并加速推理。
公告中并未透露这些技术所对应的具体模型名称、参数量或性能数据。
TokenSpeed day-0 支持的意义
day-0 支持意味着 Qwen 新模型一旦正式发布,TokenSpeed 用户即可在同一时间使用相应的推理优化路径,无需等待后续适配。对于需要在生产环境中快速部署新模型的服务方而言,这种「发布即可用」的节奏可以显著缩短上线周期。TokenSpeed 由社区开发者 lightseekorg 维护,此次获得官方致谢,也反映出 Qwen 在新架构落地过程中与开源社区的紧密协作。
信息有限,后续有待披露
需要指出的是,这条公告仅为一条简短的致谢动态,关于新架构的完整技术报告、benchmark 表现、上下文长度、是否开源权重等关键信息均未给出。读者若需了解 GDN、QSA 等术语的具体含义与实现细节,仍需等待 Qwen 后续发布完整的技术文档或论文。
