桃子桃子快讯
返回首页
研究论文

Ovis-Embedding:统一全模态嵌入模型,跨四模态刷新基准

基于 Qwen-omni 的 Ovis-Embedding 在 MMEB 等五个基准上取得 SOTA,支持文本、图像、视…

2026.09.23 · 周三2 分钟阅读

arXiv 上新近出现了一篇关于通用嵌入模型的研究报告,介绍了名为 Ovis-Embedding 的全模态嵌入家族。它以单一共享的多模态主干替代传统的「各模态独立塔」结构,将文本、图像、视频与音频统一编码到同一表示空间中,目标直指「任意模态到任意模态」的检索。论文归纳了三大关键技术贡献。

基于 Qwen-omni 的原生全模态初始化

作者以预训练的 Qwen-omni 模型作为嵌入主干,通过对比学习并配合低秩初始化策略完成适配。这一做法使得模型在进入嵌入训练阶段时,便已具备对四种模态的联合理解能力,避免了从零搭建多模态塔带来的模态割裂问题。

以数据为中心的全模态训练

研究团队构建了一个覆盖文本、图像、视频、音频以及交错多模态数据的大规模高质量数据集,并引入「同源采样」策略来组装任务一致的批次,同时利用批次内有信息量的负样本提升数据效率。这种以数据组织为核心的训练方法被视为模型性能的重要来源之一。

面向嵌入的训练与推理优化

训练阶段使用 Focal Loss 强化对困难样本的关注,并提出基于相似度的 Embedding Distillation,从互补的教师模型中迁移细粒度相似度结构;推理阶段则引入低秩特征分解,支持以更紧凑的维度输出嵌入,并在性能损失最小化的前提下灵活调节表征维度。

多基准评测表现

论文报告的实证结果显示,Ovis-Embedding 家族在 MMEB-v3、MMEB-v2、MVEB、MAEB 以及 RTEB 等多个主流嵌入基准上取得当前最优成绩,覆盖文本、图像、视频与音频四个模态。作者认为,这一结果验证了统一全模态训练在缓解模态碎片化、推进通用嵌入模型方面的潜力。

信源