桃子桃子快讯
返回首页
模型发布

Reka 发布端侧多模态模型 EdgeQ:面向高通骁龙 8 Elite

Reka 推出专为高通 Hexagon NPU 优化的端侧视觉语言模型 EdgeQ,首 token 时延 0.73 秒,…

2026.09.23 · 周三2 分钟阅读

AI 公司 Reka 在 X 平台宣布推出面向端侧设备优化的视觉语言模型(VLM)EdgeQ,主打在穿戴设备和手机等算力与电池受限的硬件上实现实时多模态感知。该模型专为高通骁龙 8 Elite 的 Hexagon NPU 进行原生适配,宣称在保持低功耗的同时可显著降低长时间运行带来的热降频风险。

核心性能数据

Reka 在官方帖文中给出了 EdgeQ 在三项关键指标上的表现:

  • 首 token 时延:图像输入下的 Time to First Token 为 0.73 秒,在同类端侧 VLM 中处于较快水平。
  • 视频理解能力:在 MLVU 长视频理解基准上较 Gemma 4 E4B 高出 34 分
  • 能耗表现:单次推理约 6.9 mWh,官方称相比常规方案可降低约 3 倍热开销。

技术实现思路

EdgeQ 的关键设计在于把视觉编码与解码模块都直接交给 NPU 完成,使 GPU 在推理过程中保持完全空闲,从而减少持续高负载下的热积聚。具体来看:

  • 视觉端采用 ConvNeXt V2 架构,并针对 Hexagon NPU 的指令集做了定制微调;
  • 解码器同样面向 NPU 重写,避免在 CPU/GPU 之间频繁搬运中间特征;
  • 由于 NPU 接管了主要计算,芯片整体功耗曲线更平缓,更适合穿戴设备等被动散热场景。

定位与适用场景

Reka 将 EdgeQ 定位为面向「物理 AI」(physical AI)的端侧方案,强调实时感知、低功耗与持续运行的稳定性,适合 AR 眼镜、智能手机、智能手表等对热设计功耗(TDP)敏感的终端。对于希望在本地完成视频理解、场景识别、图像问答等任务的开发者与硬件厂商,EdgeQ 提供了一条免云端依赖的部署路径。

Reka 同时附上了详细的工程拆解博客链接,供开发者参考具体的模型结构与调优方法。值得注意的是,帖文中提及的「Gemma 4 E4B」等竞品型号以官方公布的对比数据为准,第三方独立验证仍待后续披露。

信源