开源
腾讯开源 WeMM-Embedding 多模态嵌入模型
腾讯发布基于 Qwen3.5 的 WeMM-Embedding 系列多模态嵌入模型,提供 9B/4B/2B 三种规格,支…
2026.08.25 · 周二约 2 分钟阅读
腾讯近日开源了 WeMM-Embedding 多模态嵌入模型系列,包含 9B、4B、2B 三个参数规格,模型基于 Qwen3.5 构建,可处理文本、图像、视频、视觉文档以及交错多模态输入,统一输出 4096 维 L2 归一化向量。
模型概览
WeMM-Embedding 是一个通用多模态嵌入模型,覆盖文本、图像、视频和视觉文档四类模态,同时支持多种模态的交错输入。模型输出统一为 4096 维 L2 归一化向量,便于直接用于向量检索、相似度计算与下游任务。
当前版本不支持音频输入,开发者在使用时需留意模态覆盖范围。
规格与开源情况
模型权重已在 HuggingFace 开源,三个规格分别对应不同部署需求:
- 9B 版本:huggingface.co/tencent/WeMM-Embedding-9B
- 4B 版本:huggingface.co/tencent/WeMM-Embedding-4B
- 2B 版本:huggingface.co/tencent/WeMM-Embedding-2B
技术报告随仓库一同发布(github.com/Tencent/WeMM-Embedding/blob/main/assets/WeMM_Embedding_tech_report.pdf),架构细节、训练数据构成与评估方法可查阅该 PDF。
典型应用场景
多模态嵌入的核心价值在于把异构数据映射到同一向量空间,从而支撑跨模态检索、推荐与 RAG 管线。WeMM-Embedding 凭借对视频与视觉文档的原生支持,潜在应用包括:
- 视频内容检索、片段匹配与自动标签
- 截图、扫描件等视觉文档的语义搜索
- 电商场景下图像与文本的联合检索
- 多模态 RAG 中的统一向量召回
仍待验证的问题
目前公开信息尚未披露完整 benchmark 数据与横向对比结果,模型在 MMEB、ViDoRe 等主流多模态嵌入评测上的实际表现有待技术报告与社区复现确认。此外,9B 规模对推理显存要求较高,中小规格的取舍仍是开发者选型时的关键变量。
