桃子桃子快讯
返回首页
研究论文

紫东太初提出 GMC 核心集剪枝:视觉 Token 减八成仍保多模态性能

紫东太初团队提出免训练的视觉 Token 剪枝方法 GMC,在 Qwen2.5-VL 与 LLaVA 上减少 80% 以…

2026.08.12 · 周三5 分钟阅读

中国科学院自动化研究所紫东太初大模型团队提出了一种名为 GMC(Grounded Message Coreset Pruning)的视觉 Token 核心集剪枝方法。该方法无需训练、无需外部依赖,可在 Qwen2.5-VL、LLaVA 等主流视觉语言大模型上直接使用,在减少 80% 以上视觉 Token 的同时近乎完整保留多模态理解能力,对高分辨率、长上下文场景下的推理效率与显存开销具有明显改善作用。论文已在 arXiv 发布。

研究背景:视觉 Token 冗余成多模态落地瓶颈

随着视觉语言模型分辨率与图文理解能力提升,一张图像常被编码为数百至上千个视觉 Token。这些 Token 全程参与解码计算并长期占用 KV Cache,带来显存开销大、推理速度慢、部署成本高等问题,成为多模态模型规模化落地的关键瓶颈。

当前业内常用方案是 Top‑K Token 筛选:对每个 Token 独立打分后只保留得分最高的样本。但高分 Token 往往集中在画面显著区域,反复保留同质化冗余信息,容易遗漏文字、数字、坐标轴、空间关系等分散但关键的互补证据;而低分 Token 被直接删除后,细节信息永久丢失,导致模型出现「压缩必掉精度」的现象,视觉幻觉也随之增多。

方法核心:双阶段架构化解冗余与丢失矛盾

GMC 跳出「筛选单个最优 Token」的传统思路,认为视觉语言模型依赖的是全体 Token 构成的集体消息,因此压缩需同时解决「信息保留位置」与「保留 Token 的信息承载方式」两个问题。整体方法由两个阶段组成。

  • 互补证据自适应筛选:同时从问题语义、视觉外观与空间位置三个角度构建证据。利用视觉语言模型内部的视觉—文本注意力识别与当前问题直接相关的区域;依据视觉特征相似性保护图像中的不同外观结构;通过原始图像坐标保留图表、文档与关系推理任务中关键的位置和几何信息。选择关键 Token 时,根据其对「尚未覆盖证据」的新增贡献来决定,由此让有限 Token 预算被分配给多种互补信息。
  • 群体互补信息传输:仅选出代表性位置并不足以避免信息丢失,因此 GMC 进一步提出 Population Transport 机制,将所有待删除 Token 的隐藏状态传输到最合适的代表 Token 中。该过程综合考虑视觉特征相似性与空间邻近关系,把大量视觉 Token 聚合为少量紧凑表示,再删除未选中的视觉 Token,由模型在压缩后的序列上继续注意力计算。

整个流程无需任务标签、参数更新、辅助检测器、OCR 模型或任何外部模型,可直接用于已有视觉语言多模态大模型,并实现真实序列压缩而非简单掩码隐藏,因此能实际减少后续解码层计算与 KV Cache 占用。

实验结果:高压缩率下保持甚至略优于完整模型

团队在 TextVQA、ChartQA、MME、POPE、MMBench、GQA 等主流视觉理解基准上,基于 Qwen2.5-VL-7B-Instruct 与 LLaVA-1.5-7B 完成全量验证。

  • 在 Qwen2.5-VL-7B 上:完整模型包含 1296 个视觉 Token。当 Token 减少 80.2%、仅保留 256 个时,GMC‑H2 保留完整模型 97.78% 的平均能力;当进一步减少 90.1%、仅保留 128 个时,GMC‑L16 仍保持 99.11% 的平均能力。
  • 在 LLaVA-1.5-7B 上:GMC‑L16 分别保留 128 个与 64 个视觉 Token 时,平均性能达到完整模型的 99.76% 与 99.82%,证明方法可迁移到不同视觉语言模型架构。
  • 在 POPE、AMBER、HallusionBench、CHAIR 等视觉幻觉评测中,相同 Token 预算下 GMC 保持更好的事实一致性,减少错误描述与信息遗漏。
  • 长文档问答场景:面对 15876 个原始视觉 Token 的输入,GMC 在保留完整模型 98.87% 问答质量的前提下,实现 1.258 倍端到端推理加速,并减少 73.94% 的提示 KV Cache。

实验还显示,GMC 在压缩后性能甚至略高于完整模型基线,表明该方法不仅能减少计算量,还可通过移除无关信息带来一定去噪增益,轻微提升多模态理解能力。

落地价值与下一步

GMC 的核心优势可归纳为四点:全程免训练且无额外依赖;压缩不降质并附带去噪增益;在 POPE、HallusionBench 等幻觉评测中表现突出;可迁移至不同架构的 7B 级多模态模型,覆盖通用图文问答、图表解析、长文档识别等业务场景。

随着多模态大模型向高分辨率、长上下文、复杂真实场景演进,Token 冗余带来的算力与显存成本已成为产业规模化落地的核心阻碍。紫东太初团队表示,GMC 提供了一种高效、可信的多模态部署新范式,未来将持续迭代技术体系,适配更多大模型架构与复杂业务场景,推动国产多模态大模型高效、低成本、规模化落地。论文地址:https://arxiv.org/abs/2608.02134v1

信源