桃子桃子快讯
返回首页
工具

Yahoo 用 Amazon Bedrock 改造搜索重定向:Claude 3.5 Sonnet v2 加持关键词扩展

Yahoo 在 DSP 中以 Claude 3.5 Sonnet v2 替代 Word2Vec+LSH 关键词扩展,中位…

2026.07.31 · 周五3 分钟阅读

Yahoo 在其全渠道需求方平台(DSP)的搜索重定向(SRT)功能中,引入 Amazon Bedrock 与 Claude 3.5 Sonnet v2 替换原有 Word2Vec + 局部敏感哈希(LSH)的关键词扩展管线。AWS 机器学习博客披露的数据显示,新方案在严格相似度阈值下,中位扩展比提升约 5 倍,最大扩展比翻倍。

业务背景与旧方案瓶颈

搜索重定向是 Yahoo DSP 的核心受众定向能力,目标是根据用户历史搜索行为,在展示、视频与原生广告中匹配与之相关的广告活动。其底层依赖一组由广告主定义的种子关键词,再通过算法扩展出语义相关词,扩大可触达人群。

旧方案使用 Word2Vec 生成词向量,再借助 LSH 做近邻检索,整体流程包括关键词归一化、生成 embedding、构建索引、LSH 检索、敏感词过滤与排序。该方案长期存在四类问题:

  • 词汇陈旧,难以反映新兴术语;
  • 偏重短语级匹配,对具体实体识别不足;
  • 依赖句法相似性而非语义相似性;
  • 部分场景下扩展为零,无法补充新词。

基于生成式 AI 的新架构

新方案利用 Amazon Bedrock 的无服务器接口调用多种基础模型,团队使用 Amazon SageMaker Studio 对 Amazon Titan、Meta Llama 与 Anthropic Claude 等多款模型做了原型评估,最终选定 Claude 3.5 Sonnet v2 作为默认模型,主要依据是它在扩展比与语义相似度两项指标上的综合表现。

整体流程被重构为:广告主设定种子关键词 → 后端调用 Bedrock 上的 LLM 生成扩展关键词 → 通过 embedding 相似度做验证过滤 → 原始词与扩展词一同写入 Amazon OpenSearch Service,供 Batch Scoring 流程匹配用户搜索历史。

防幻觉与合规护栏

团队在评估中发现 LLM 会出现幻觉,因此加入了一道验证环节:扩展关键词重新转成 embedding,与原始种子词集做余弦相似度比较,低于阈值的结果会被剔除,确保留下的词与原始意图保持一致。

广告场景还需要兼顾额外的合规约束,包括:

  • 敏感关键词过滤;
  • 受众段级别的拒绝名单;
  • 用户隐私偏好;
  • 平台与广告政策合规。

效果与启示

在严格相似度阈值下,Claude 3.5 Sonnet v2 经常一次性产出数百甚至上千条扩展词,而旧 LSH 方案在部分种子词下产出为零。中位广度扩展比约为原来的 5 倍,最大扩展比翻倍,整体覆盖人群明显扩大。

案例本身并非新模型发布,但对正在评估 LLM 落地搜索/广告/语义扩展类应用的工程团队具有参考价值:模型并非越新越大越好,关键是配合 embedding 验证、合规过滤与业务指标评估,才能在生产环境中稳定使用。

信源