高通发布第六代骁龙 8 至尊版:2nm 制程,支持端侧 300 亿参数 MoE 大模型
高通推出第六代骁龙 8 至尊版及超级至尊版移动平台,2nm 工艺,CPU 主频达 5GHz,NPU 支持 300 亿参数…
高通正式发布第六代骁龙 8 至尊版与第六代骁龙 8 超级至尊版两款旗舰移动平台,二者均采用 2nm 制程,并在 CPU、GPU、NPU 三个核心计算单元全面围绕智能体调度与端侧大模型部署进行架构重构。这是高通首次将 300 亿参数 MoE(混合专家)大模型完整运行在手机端,并与千问、豆包、阶跃等多家中国大模型厂商达成合作,被官方称为「移动技术新的转型时刻」。
CPU:5GHz 主频与动态缓存池
新一代 Qualcomm Oryon CPU 最高主频达到 5GHz,高通称其为「全球最快移动 CPU」。相比前代,单核性能提升 13%,能效提升 37%,响应速度提升 15%。
本次架构升级的重点之一是 Oryon FlexCache。这一缓存架构将原本与核心绑定的缓存资源重构为一个可动态分配的缓存池:当某一颗超级核心承担突发高负载任务时,可以按需调用近乎整个缓存池,同时维持低时延。对于智能体频繁调度、负载突变的场景,这一设计有助于保障响应速度。
GPU:面向 AI 的 Matrix Cores 与 Neural Fusion
新一代 Adreno GPU 性能提升 44%,能效提升 40%,被高通称为「迄今最大的代际跃升」。GPU 内部新增 Matrix Cores,使神经网络计算能够直接在图形渲染管线内完成,无需将数据搬运至其他计算单元。
基于 Matrix Cores,高通推出 Adreno Neural Fusion 技术,可在维持峰值性能的同时降低功耗并保持高帧率。该技术已率先在 Unity 和虚幻引擎等主流游戏引擎中落地,成为首个在移动端引擎上实现的 AI 超级分辨率方案。搭载超级至尊版的手机已可拍摄 8K 60fps 视频。
NPU:面向 Transformer 与 30B 模型部署
新一代 Hexagon NPU 引入专门针对生成式 AI 与智能体工作负载设计的 Element Accelerator,与原有向量、标量计算单元协同,加速大模型中的关键运算。Hexagon NPU 的大容量共享内存扩容最高达 50%,可将上下文与 KV-cache 数据保留在 NPU 内部,减少对 DDR 的访问次数,降低读取时延。
针对 INT4 模型,新一代 NPU 的预填充速度提升 50%,以加快提示词处理与上下文理解速度。同时,开发者仍可使用 INT2、INT8、FP8、FP16 等多种精度,灵活平衡性能、内存、模型质量与功耗。
生态合作:多家中国大模型厂商落地
高通在发布会上公布了端侧 AI 生态合作进展:
- 海外首次亮相的千问平板 QwenBook;
- 与豆包手机的合作;
- 与阶跃、无量火、江波龙等合作,实现 300 亿参数 MoE 模型的完整端侧部署。
高通 CEO 安蒙在发布会上表示,移动技术正进入「以智能体为中心」的新转型时刻,并强调这一进程已经发生,而非远期愿景。
终端落地与后续规划
小米、vivo、红魔、REDMI、OPPO、一加、摩托罗拉、iQOO、荣耀等品牌将率先在其旗舰产品中采用这两款新平台。小米即将发布的 18 Pro 新机已在发布会现场亮相。在未来两天内,高通还将围绕个人 AI 推出可穿戴、PC 等领域的新品。
