研究论文
Q2D-Web 发布:1.9 亿文档规模检索评估数据集
研究者推出 Q2D-Web 数据集,结合 1.9 亿网页文档、6.9 万条智能体重写查询与深度相关性标注,用于更真实的检…
2026.09.10 · 周四约 2 分钟阅读
近日,研究者推出了名为 Q2D-Web 的大规模检索评估数据集,旨在解决现有检索基准在文档规模、查询多样性与相关性标注深度方面的不足。该数据集通过整合海量网页文档与经过智能体改写的查询,为评估检索系统提供了更接近真实场景的测试环境。
数据集规模与构成
Q2D-Web 的核心数据规模显著高于以往主流检索基准,主要由三部分组成:
- 网页文档池:包含约 1.9 亿(190M)条真实网页文档,覆盖广泛的领域与主题。
- 查询集合:共 69,721 条查询,这些查询经过 agent 智能体改写,更贴近用户真实检索意图。
- 相关性标注:合并集合中平均每条查询拥有 99.6 条正例标注,标注深度大幅提升。
为何需要「真实」检索评估
传统的检索评估往往依赖较小的语料库与有限的查询集合,且相关性标注不够完整,容易产生大量「假阴性」——即实际上相关但未被标注的文档。Q2D-Web 的设计理念正是要缓解这一问题:
- 大规模语料:1.9 亿文档的规模使评估更接近实际搜索环境,避免在小型集合上过拟合。
- 查询多样性:通过智能体重写,查询覆盖更广泛的表达方式与意图粒度。
- 深度标注:近 100 条正例/查询的平均标注密度,显著降低假阴性率,提高评估信号的可靠性。
对 RAG 与检索系统研究的意义
Q2D-Web 的发布对依赖检索增强生成(RAG)的应用场景具有直接参考价值。大规模、高质量标注的检索基准能够帮助研究者更准确地衡量 embedding 模型、重排器以及端到端检索管线的真实表现,减少在「玩具数据集」上得出的乐观结论。同时,agent 改写查询的设计也反映了真实用户查询往往并非简单关键词这一趋势,对检索系统的鲁棒性提出了更高要求。
目前该数据集的完整论文与下载入口可通过原始链接获取,尚未公布更多关于参与机构与具体评估协议的细节。
