Q2D-Web 上线:面向 Agentic RAG 系统的大规模检索基准与公开榜单
研究团队推出 Q2D-Web 基准及公开排行榜,测试 embedding 模型在智能体重写查询后的大规模网页检索表现。
一个名为 Q2D-Web(Query2Doc-Web)的新基准与公开排行榜近日在 X 平台亮相,专门用于评估 agentic RAG(智能体检索增强生成)系统中的检索环节。该基准聚焦于一个具体问题——当大模型或智能体对用户原始查询进行改写(reformulation)后,embedding 模型在大规模网页搜索场景下的检索表现是否仍能保持稳定与准确。
聚焦场景:智能体重写后的检索
在典型的 RAG 流程中,检索质量直接决定生成答案的上限。而在 agentic RAG 设定下,大模型会先将用户的口语化提问改写为更结构化、更适合搜索引擎的查询,再交给检索系统去召回相关网页。这一步改写虽然能提升召回的相关性,但同时也会让查询分布偏离 embedding 模型原始训练数据,给检索带来新的挑战。Q2D-Web 正是针对这一中间环节设计的评测基准。
基准定位与公开榜单
按照发布方的描述,Q2D-Web 包含两个组成部分:
- 一个标准化的评测数据集,覆盖大规模真实网页搜索场景;
- 一个公开的 leaderboard,供不同 embedding 模型进行横向对比。
评测对象是 embedding 模型本身,而非端到端的大模型生成质量。换言之,它回答的是「在智能体已经改写好查询的前提下,谁家的向量检索模型召回更准」这一细分问题,而不是「哪个大模型整体更强」。
当前信息披露的局限
需要指出的是,本次公告仅有简短文字说明,尚未公开论文、数据集规模、评测指标体系、首批上榜模型成绩等关键细节。基准的具体构造方式、查询改写策略的多样性、是否覆盖多语言或长上下文场景,以及与现有 MS MARCO、BEIR 等检索基准的关系,目前均未在公开信息中给出。读者如需了解完整方法论与结果对比,仍需等待后续论文或技术博客披露。
对正在构建 agentic RAG 系统的开发者与研究者而言,Q2D-Web 的出现意味着检索环节有了专门的「智能体语境」评测工具。后续随着更多 embedding 模型上榜,该榜单有望成为选型时的重要参考。
