桃子桃子快讯
返回首页
模型发布

微软发布 Mage-VL:4B 多模态基础模型主打流式视频理解

微软推出 Mage-VL,采用从零训练的 Codec-ViT 与 Qwen3-4B 骨干,视觉 token 削减 75%…

2026.07.27 · 周一5 分钟阅读

微软发布 Mage-VL 多模态基础模型,专门面向流式视频理解场景重新设计视觉编码器。该模型采用从零训练的 4B 参数 Codec-ViT 视觉编码器,配合 Qwen3-4B-Instruct-2507 语言骨干,通过编解码器对齐的稀疏采样将视觉 token 削减 75% 以上,并实现最高 3.5 倍的 wall-clock 推理加速。模型与独立视觉编码器 Mage-ViT 已同步开源至 Hugging Face。

设计动机

Mage-VL 的核心设计目标是解决当前视觉语言模型(VLM)在实时流式感知中的效率瓶颈:现有模型在复杂离线推理上表现强劲,但在简单实时流式任务中既慢又重。

不同于传统做法——将视频解码为均匀采样的帧,再将密集 patch token 送入冻结的 ViT——Mage-VL 借鉴现代视频编解码器的结构:

  • 将视频流拆分为锚点(I 帧)与预测帧(P 帧)
  • 保留全部锚点 patch
  • 仅保留预测帧中编解码器实际分配 bit 的区域 patch(含真实运动与新细节)

这种 codec 对齐的稀疏性可在保留时空上下文的前提下,将视觉 token 削减超过 75%,在匹配精度下带来最高 3.5 倍的推理加速。

核心架构

整个系统由两个组件构成。

Mage-ViT:从零训练的 Codec-ViT 视觉编码器,基于 16×16 patch 网格与 3D 旋转位置编码,按 codec 推导出的时空重要性分配 token。其接口具备 codec 无关性:

  • 传统编解码器(H.264/AVC、HEVC/H.265):通过运动矢量与残差能量输入
  • 神经编解码器(DCVC-RT):通过其学习到的率图输入

两种输入均无需修改架构或重新训练。

Qwen3-4B 因果解码器:以 Qwen3-4B-Instruct-2507 语言模型为骨干(系统中唯一预训练的组件),通过轻量级两层 MLP 投影器消费 Mage-ViT 的可变长度 token 流,统一支持图像、短/长/超长视频与流式输入。

在此之上,模型引入 System 1 / System 2 双过程设计,将主动流式能力内嵌到单一模型中:轻量级 cognition gate(System 1)持续观察每个滚动 codec 窗口,对常规内容保持沉默,仅在出现值得响应的完整事件时调用完整 VLM(System 2),无需多智能体管线。

关键性能

  • 数据高效:仅用约 1 亿未标注图像/视频训练,Mage-ViT 即可与基于数十亿图文对训练的前沿编码器相媲美或超越——CIFAR-10 达 99.33%,ImageNet 在 256 token 时达 85.69%
  • 原生分辨率缩放:可变分辨率预训练使性能随 token 预算单调提升,在 676 token 时 Food-101 超 96.1%、ImageNet 超 86.3%
  • 视频基准全面领先:固定 4B Qwen3 骨干、仅替换 ViT,Mage-VL 在所有报告的视频与时序定位基准上均优于 Qwen3-VL-4B,定位密集任务提升最为显著(QVHighlight +22.5、ActivityNet +17.1、VSI-Bench +11.0、VideoEval-Pro +24.5)
  • 静态图像持平、视频与空间智能领先:与 Qwen3-VL-4B 在静态图像上持平,在视频理解与空间智能上明显领先(VSI-Bench +11.0、CrossPoint +53.1、EmbSpatial +5.2)
  • 主动流式:冻结骨干的 cognition gate 在 SoccerNet 流式任务的 TimVal / F1 / ROC-AUC / PR-AUC 上均居首位,并可泛化至真实的 2026 世界杯转播信号

模型发布

Mage-VL 以单一 checkpoint 形式开源(microsoft/Mage-VL),统一覆盖图像与视频理解、主动流式门控、H.264/HEVC 传统编解码视频、DCVC-RT 神经编解码视频以及事件门控流式输出。仓库内含 codec 处理器、神经编解码包与 proactive gate 权重,无需额外的理解、流式或 NVC 检查点。

同时,团队另发布 microsoft/Mage-ViT——独立视觉编码器,仅经过两阶段从零 ViT 预训练(约 1 亿未标注图像/视频帧的聚类判别),未经过 VLM 联合训练,可作为数据高效、codec 原生的视觉编码器直接使用,也可作为自有多模态训练的 ViT 底座。

信源