研究论文
Q2D-Web:覆盖十种语言的万级生产级搜索查询改写评测集
一个面向 Web 搜索场景的查询改写评测数据集,含 2.3 万条去标识化样本,覆盖十种语言。
2026.09.10 · 周四约 1 分钟阅读
Q2D-Web 是一个面向 Web 搜索场景的查询改写(query reformulation)评测数据集,旨在为搜索系统中由 AI 智能体驱动的查询理解与改写环节提供标准化评估基准。该数据集的核心特点是直接来源于生产环境,而非人工构造,能够较好地反映真实搜索场景中用户请求的多样性与复杂性。
数据规模与覆盖范围
Q2D-Web 共包含约 2.3 万条经过去标识化(不含个人身份信息)处理的生产级搜索记录,采集时间跨度长达九个月,覆盖十种语言与数十个领域。这一规模在查询改写类评测集中属于较大体量,且多语言、多领域的覆盖有助于评估模型在不同场景下的泛化能力。
标注方式与任务设计
在任务设计上,该数据集引入了「主查询(primary query)」与「辅助查询(support query)」的分层结构:由智能体(agents)将原始用户请求拆解并改写为不同层级的查询,每个层级的查询均独立评估,并配有各自的相关性标注(relevance judgments)。这种结构允许研究者分别考察模型在主意图识别与辅助信息补充两个子任务上的表现。
当前局限
目前公开信息仅包含上述概要性描述,尚未披露具体的论文链接、机构来源、标注细则、基线模型表现等关键细节。该数据集的实际学术价值与影响力,仍有待完整论文或技术报告发布后进一步评估。
