桃子桃子快讯
返回首页
研究论文

MLVC 神经视频编解码器:尝试解决跨平台 NPU 部署难题

论文 MLVC 通过超先验传递熵模型参数,绕过跨 NPU 比特一致性难题,在消费级 NPU 上实现约 100 FPS 编…

2026.07.31 · 周五2 分钟阅读

现有的传统视频编解码器(如 h.264、h.265、AV1)仍主导实际应用,而基于神经网络的视频编解码器长期面临计算效率与跨平台兼容性问题。最新论文 MLVC 提出通过超先验显式传输熵模型缩放参数的方法,使编解码器在不同厂商 NPU 上不必做比特级一致运算,从而向「可实际部署的神经视频编解码」迈进一步。

背景:为什么神经视频编解码器难以落地

Alexnet 开启神经网络取代手写规则系统的浪潮至今已 14 年,但视频压缩领域仍由传统编解码器主导。原因主要有两点:

  • 计算与能效:神经编解码器模型体积较大、功耗较高,而 h.264/h.265/AV1 已在各类硬件中获得广泛加速支持,部署成本极低。NPU 看似是天然契合神经编解码器的硬件平台。
  • 跨平台兼容性:若在 Apple NPU 上编码、在 Intel NPU 上解码,浮点运算的微小数值差异可能导致熵模型在两端不一致,进而使熵解码失败,整个码流无法还原。

现有方案的局限

理论上,完整规范化的定点整数运算可保证比特级一致结果;但当前硬件与工具链并不足以实现这一点:

  • 例如 Apple M3 神经引擎上相关 INT8 运算实际由 FP16 模拟,并非走真正的 INT8 通路。
  • 即使硬件支持 INT8,开发者也无法完全控制舍入模式、累加数据类型、缩放乘法等细节,比特级一致结果仍难保证。

仅靠模型量化与整数运算并不能稳定解决问题。

MLVC 的核心思路与初步结果

MLVC 通过显式将熵模型缩放参数写入超先验比特流,让神经网络本身不再需要跨 NPU 比特级一致运行,从而绕开上述兼容性问题。论文披露的初步性能数据:

  • 在消费级 NPU 上,360p / 540p 视频的编码与解码速度均可达约 100 FPS。
  • 论文与代码已公开,作者在 Reddit 主动参与答疑。

待观察

该方案能否在更高分辨率、更高码率与更多硬件平台上验证,以及与传统编解码器在压缩效率上的全面对比,仍需后续独立测试与同行评审进一步检验。

信源