高通骁龙峰会:端侧智能体从演示走向完整工作流
高通在2026骁龙峰会上展示第六代骁龙8至尊版2nm双旗舰,并联合阶跃等厂商演示端侧30B-MoE智能体完整任务流程。
过去一年,AI 编程和办公工具在 PC 端快速普及,但手机上的 AI 体验仍以单次问答和图片处理为主。在 2026 年骁龙峰会上,高通希望证明:端侧 AI 也可以进入更完整的生活与工作场景。第六代骁龙8至尊版与「超级至尊版」双旗舰同时亮相,采用 2nm 工艺,其中 CPU 负责工具调用和任务调度,NPU 承担模型推理,低功耗感知单元处理后台信息——为不同类型的 AI 工作分配专属计算通道。搭载超级至尊版的设备频率已拉到 5GHz,新双 Micro NPU 架构性能提升 85%、功耗降低 20%,目的是让一个常驻智能体既不持续发烫,也不迅速耗电。
从装模型到跑完整工作流
今年峰会上最核心的演示,是一段完全在端侧完成的连续任务:AI 读懂一封邮件,提取行程信息,同步日历,推荐航班和酒店,再草拟回复。底层是高通与阶跃星辰、无量火科技、江波龙四方协作的 30B-MoE 模型部署——高通提供计算平台,阶跃提供模型,无量火优化推理与调度,江波龙处理存储协同,AI Hub 复用优化成果以降低部署门槛。
对比 2024 年最多 7B 模型可上端侧,如今 30B 的 MoE 模型在参考设计上完成邮件理解、行程规划与日历同步,被高通视为一次可感知的跨越。更复杂的 AI 应用也可以由多个模型分工完成:高通合作伙伴 Deepgram 展示的 AI 播客应用中,NPU 上的语音模型负责转写并区分发言者,GPU 上的 Gemma 模型理解话题、生成追问建议,「异构计算」由此变成读者可感知的场景。
高通公司总裁兼首席执行官安蒙(Cristiano Amon)表示:「智能体 AI 并不仅仅是为终端新增一个功能。它实际上创造了一种全新的终端工作流程。」这意味着 AI 不再只在用户提问时工作,还要在后台保留信息、等待时机并接续任务。
智能眼镜与开发者生态
智能眼镜是高通展示的另一个典型品类。2025 年 6 月 AWE 上,骁龙 AR1+ Gen 1 已用原型眼镜演示 Llama 3.2-1B 本地运行;今年,高通进一步为 AR1、AR1+ 提供多模态 1 比特模型支持,并推出 START 计划,向非科技厂商提供 AR1+ 模组、软件平台与参考设计,降低集成门槛。
游戏侧,高通也发布了全新的 Adreno Neural Fusion,借助 AI 实现智能图形渲染,带来更强的移动游戏沉浸感与更长的续航表现。
模型迭代更快,芯片竞争更复杂
高通面对的压力是多重的。守住手机基本盘之外,还要进入数据中心、PC、汽车、眼镜等多个市场。高通已提出 2029 财年非手机收入 400 亿美元的目标,并推进数据中心业务。但模型迭代节奏正在重新定义芯片厂商的协作方式——「过去智能手机完成适配后,可能 9 到 12 个月都无需调整;现在大模型每 3 个月甚至更短就会迭代一次」,高通公司中国区董事长孟樸对 36 氪在内的媒体表示。竞争焦点从「能装进多大模型」转向「新模型出来后,谁能更快、以更可控的成本交付可用体验」。
9 月的同类动向已很密集:联发科发布天玑 9600 系列,9600 Pro 同样采用 2nm,强调低功耗常驻感知并宣称支持 30B-MoE 端侧运行。客户一侧的竞争也在加剧——小米玄戒 O1 进入量产,苹果在 iPhone 16e 推出自研 C1 基带;数据中心方面,英伟达 2027 财年第二季度数据中心收入已达 890 亿美元,而谷歌自研 TPU 同时是高通在终端上的重要合作伙伴。
孟樸同时指出,一款产品展示当前技术的上限,另一款则更注重效率以控制成本。技术推进能否被客户采用,最终仍要过成本这一关。半导体行业人士也总结了一个朴素标准:智能体在端侧运行,「不能做错任务,不能过度占用内存,还不能增加续航负担,起码不能比手动操作还慢」。
高通公司中国区董事长孟樸对 36 氪表示,跨终端持续服务的个人智能体,可能要到 2027 至 2028 年才会比较稳定地逐步落地。对高通而言,下一轮胜负不只取决于它能把多大的模型装进终端,更取决于能否让不断变化的模型,及时变成用户愿意反复使用的产品。
