桃子桃子快讯
返回首页
开源

腾讯开源 EVIE-Preview-4.5B 视觉文档检索模型

腾讯在 Hugging Face 发布 4.54B 参数的多语言视觉文档检索模型 EVIE-Preview,采用 128…

2026.08.17 · 周一3 分钟阅读

腾讯在 Hugging Face 开源了预览版视觉文档检索模型 EVIE-Preview-4.5B,采用 ColBERT 风格的 late interaction 架构,并结合原生 GatedDeltaNet 线性注意力与全注意力混合建模,目标是在保持检索精度的同时,大幅压缩向量存储与索引开销。该模型共 4.54B 参数(BF16),原生输出 128 维多向量 token embedding,可在 Hugging Face 直接获取权重。

架构与核心思路

模型在底座选择上以 Qwen3.5-4B 为基础,并在其上叠加紧凑的视觉投影层。检索侧采用 ColBERT 风格的 late interaction,配合多向量表征,使得 query 与 document 的相关性可在 token 级别细粒度计算。区别于常见的 1024D、2560D 乃至 4096D 表征,EVIE 直接输出 128 维多向量。

官方在文档中给出了节省对比:在存储与索引层面,相比 2560D–4096D 的同类表示,EVIE 可将向量存储与索引成本压缩 8× 至 32×,而检索精度并未出现明显下降,这对企业级 RAG 与文档库的部署成本是直接利好。

ViDoRe 基准表现

模型在视觉文档检索主流基准 ViDoRe 上宣称达到了当前最优水平:

  • 在 ViDoRe V3 上,EVIE-Preview-4.5B 领先于多款更大的 8B 级模型,于公开的 8 个子领域中拿下 7 个最佳;
  • 在 ViDoRe V1+V2 综合表现上,平均 nDCG@5 达到 85.93
  • 相比同尺寸或更大体量的 VDR 模型,4.5B 的参数规模显著小于多数竞品,但指标并未打折。

需要注意的是,上述成绩来自官方模型卡与社区提交,尚未见到独立第三方复现报告。

多语言与多格式

EVIE 在零样本(zero-shot)场景下展示了较强的跨语言与跨版式能力,覆盖英语、法语、德语、意大利语、西班牙语、葡萄牙语、中文等多种语言,文档类型涵盖图表、表格、科研报告与财报等。这一覆盖面对于面向企业或国际化场景的视觉检索应用较为关键。

生态兼容性

模型与标准 colpali-engine 生态完全兼容,可以直接接入既有的 late-interaction 评分管线,开发者无需额外适配即可替换已有 VDR 检索器。对于已在使用 ColPali / ColBERT 类多向量检索的团队,迁移成本较低。

状态与后续

当前版本以「Preview」形式开源,定位于预览与社区验证,并非腾讯正式的 GA 版本。是否会有正式版本、是否会扩展到更多尺寸,仍有待官方后续披露。

信源