桃子桃子快讯
返回首页
研究论文

MLLM 视觉 Token 剪枝新方法 MAP:预测中间层注意力,推理提速 3.09 倍

arXiv 新文提出 MAP 方法,用轻量预测器替代固定中间层注意力,在 LLaVA-NeXT-7B 上以 5.56%…

2026.08.10 · 周一3 分钟阅读

多模态大模型(MLLM)在各类视觉-语言任务上表现强劲,但其推理成本被大量视觉 Token 显著推高。近日发表于 arXiv 的研究提出了一种名为「中间层注意力预测」(Middle-layer Attention Prediction,MAP)的新方法,通过学习一个轻量预测器来估算视觉 Token 重要性,从而在第一个语言模型层之前完成剪枝。该方法在 LLaVA-NeXT-7B 上以仅 5.56% 的视觉 Token 保留了 97.5% 的原始模型性能,实现了 3.09 倍端到端推理加速。

现有方法的两个瓶颈

视觉 Token 剪枝被广泛认为是降低 MLLM 推理开销的关键路径之一。此前的研究已经发现,文本到视觉的注意力(来自语言模型的中间层)可以有效指导视觉 Token 的筛选,常见做法是直接选取某个预定义的中间层,以其注意力分数决定保留哪些 Token。

然而论文作者通过分析指出,这一思路存在两个难以回避的问题:

  • 最优层因样本而异:对不同输入问题最敏感的中间层差异很大,使用固定的中间层并非最优选择。
  • 前期计算成本过高:要获得合适中间层的注意力,需要先将全部视觉 Token 送入若干层语言模型计算,而到这一步已经消耗了大量算力,「剪枝」的省效效果被严重抵消。

MAP 方法的核心设计

为同时解决上述两个问题,作者提出了 MAP 框架,包含两个关键组件:

问题对比式教师层选择

MAP 不再依赖一个固定的中间层,而是对每条样本独立挑选「教师层」。具体做法是用原始问题与一个参考问题分别触发注意力分布,通过对比两者的差异定位对该问题最敏感的中间层,从而获得样本专属的教师信号。

注意力蒸馏为轻量预测器

在确定教师层后,MAP 将该层注意力蒸馏到一个轻量预测器中。该预测器以多模态输入特征为输入,直接输出每个视觉 Token 的重要性分数,无需在推理时构建任何注意力图。推理阶段,预测的重要性分数与一项多样性准则结合,在第一个语言模型层之前完成剪枝,因此可以与已有的推理加速技术(如 KV cache 压缩、推测解码等)叠加使用。

实验结果

论文在 LLaVA-NeXT-7B 上、覆盖 10 个基准测试的条件下评估 MAP,主要数据如下:

  • 保留视觉 Token 比例:5.56%
  • 相对未剪枝模型的性能保持率:97.5%
  • 端到端推理加速比:3.09 倍

由于剪枝发生在第一个语言模型层之前,MAP 在推理时不再需要任何注意力图来辅助筛选,计算路径与传统 MLLM 解码流水线更为接近,对现有部署框架的侵入性较低。

意义与适用场景

MAP 的设计直接回应了 MLLM 部署中最受关注的成本问题之一——视觉编码与早期语言模型层带来的 Token 膨胀。对于 LLaVA-NeXT 类以视觉 Token 密集著称的模型,这种「预测式剪枝」思路提供了一条在不重训主模型的前提下提升吞吐量的路径。同时,由于不依赖运行时注意力图,MAP 更容易与各类推理加速栈协同,未来或可推广到其他视觉编码器-语言模型组合的多模态系统中。

信源