桃子桃子快讯
返回首页
模型发布

微软开源 Mage-VL:4B 多模态模型主打 codec 原生视频流

微软发布 Mage-VL 多模态模型,采用 codec 原生视觉编码器与 Qwen3-4B 解码器,视频 token 减…

2026.07.29 · 周三4 分钟阅读

微软在 Hugging Face 开源了 Mage-VL,一个面向图像与视频理解的 codec 原生流式多模态基础模型。其视觉编码器 Mage-ViT 完全从零训练,规模为紧凑的 4B,并搭配 Qwen3-4B-Instruct-2507 作为语言解码器。在保持 Qwen3 主干不变、仅替换 ViT 的条件下,Mage-VL 在所有公开报告的视频与时序定位基准上均优于 Qwen3-VL-4B。

核心思路:把视频当 codec 流来处理

Mage-VL 直指当前视觉语言模型(VLM)的一个痛点:在复杂离线推理上能力很强,但在简单的实时流式感知上既慢又重。传统做法是把视频解码为均匀采样的帧,再让冻结的 ViT 输出一整片密集的 patch token。Mage-VL 转而借鉴现代视频 codec 的结构,将视频流拆分为锚点帧(I 帧)与预测帧(P 帧),保留全部 I 帧 patch,但只保留 P 帧中 codec 实际花费比特的位置——即真正包含运动与新细节的区域。

这种 codec 对齐的稀疏化带来两个直接收益:

  • 视觉 token 用量下降超 75%,仅相当于密集帧采样的约 1/8 甚至更少;
  • 在精度匹配的前提下,推理延迟最高获得 3.5 倍的端到端加速,且在多数视频基准上为参比模型中最快。

模型架构:Mage-ViT + Qwen3-4B

Mage-VL 由两部分组成。

  • Mage-ViT:从零训练的 Codec-ViT 视觉编码器,按 codec 衍生的时空重要性分配 token,使用统一的 16×16 patch 网格与 3D 旋转位置编码。它对 codec 类型保持中立:既可接受传统 codec(H.264/AVC、HEVC/H.265)通过运动矢量与残差能量作为输入,也可接受神经 codec(DCVC-RT)通过其学习到的率图作为输入,无需修改架构或重新训练。
  • Qwen3-4B causal decoder:唯一使用预训练权重的语言主干,通过一个轻量的两层 MLP projector 接收 Mage-ViT 输出的变长 token 流,对图像、短/长/超长视频与流式输入提供统一接口。

在此基础上,Mage-VL 引入 System 1 与 System 2 双过程设计,把"主动流式推理"塞进单模型内部:一个轻量的认知门(System 1)持续观察滚动的 codec 窗口,对常规内容保持静默,仅在判定出现"值得响应"的事件时才唤醒完整 VLM(System 2),不需要多智能体管线。

关键能力与基准表现

  • 原生分辨率可扩展:在可变分辨率预训练下,Mage-ViT 的精度随 token 预算单调提升,在 676 token 时达到 Food-101 >96.1%、ImageNet >86.3%;固定分辨率编码器则容易饱和甚至退化。
  • 视频基准全面领先:以 Qwen3-4B 主干不变、仅替换 ViT 为前提,Mage-VL 在定位类任务上提升最显著,包括 QVHighlight +22.5、ActivityNet +17.1、VSI-Bench +11.0、VideoEval-Pro +24.5。
  • 小尺寸下的强表现:静态图像上与 Qwen3-VL-4B 持平,在视频理解与空间智能上明显领先(VSI-Bench +11.0、CrossPoint +53.1、EmbSpatial +5.2、QVHighlight +22.5)。
  • 主动流式输出:冻结主干的认知门在 SoccerNet 流式任务的 TimVal / F1 / ROC-AUC / PR-AUC 上均为最高,并可泛化到 2026 世界杯的真实直播画面。

训练效率与发布

由于视觉 token 大幅压缩,Mage-VL 在同等算力预算下可以训练比密集帧采样方案长约 8 倍的视频。模型已在 Hugging Face 以 microsoft/Mage-VL 开源发布,提供从零训练的 Codec-ViT 与 Qwen3-4B 解码器的组合权重,开发者可直接用于图像、视频与流式理解场景。

信源