桃子桃子快讯
返回首页
研究论文

四款 AI 助手本地推荐审计:巴厘岛 85.6% 餐饮店从未被提及

arXiv 论文对巴厘岛两区 4776 家餐饮店做全量普查,测试四款 AI 助手后发现绝大多数店铺从未被推荐,可见性与商…

2026.08.14 · 周五3 分钟阅读

导语

一项发表于 arXiv 的研究对巴厘岛 Canggu 与 Ubud 两区共 4,776 家咖啡馆、餐厅和酒吧进行了全量普查,并以此作为基准,测试 ChatGPT、Claude、Gemini、Perplexity 四款主流 AI 助手在 96 组人格化查询下的推荐表现。研究发现,85.6% 的店铺从未被任何系统推荐;即便是拥有 50 条以上评分的老店,也有 72.6% 处于「AI 视野之外」。该研究采用预注册方案、七天数据采集,是首个以完整市场为底本的 AI 本地推荐审计。

研究方法

研究团队构建了两区所有餐饮场所的注册库(census),并向四款具备搜索增强能力的 AI 助手发起 2,208 次基于真实场景的查询。每条查询附带不同用户画像,以贴近实际使用情况。整个实验在预注册协议下进行,确保假设与统计方法在数据收集前已固定。研究者同时公开了协议、注册库构建方法及派生数据,便于复现与扩展研究。

核心发现:可见性遵循「双门槛」结构

研究观察到推荐结果呈现两层决定因素:

  • 进入推荐名单的关键是文档完整度,包括评论量(OR 1.64)、拥有独立官网(OR 1.92)、公布价格信息(OR 1.54)、以及第三方网站提及(OR 1.44)。
  • 一旦进入推荐名单,星级评分才开始对排名起作用(首位的 OR 为 1.17)。
  • 评分本身在「是否被推荐」这一门槛上几乎没有影响(OR 0.89),说明 AI 系统先按可索引信息过滤,再按口碑排序。
  • 一个被普遍假设的可见性因素——出现在 Foursquare 等开放 POI 数据集——在两个门槛上都未表现出正向作用。

失效模式:陈旧数据而非幻觉

研究区分了两类错误:

  • 凭空捏造(fabrication)极为罕见,仅占全部提及的 0.08%。
  • 推荐已永久关闭的店铺却出现 93 次,说明实际的主要失败模式是「数据陈旧」而非「幻觉」。这意味着商家一旦关门但网络痕迹未清除,仍会持续出现在 AI 推荐中。

跨系统一致性较低

四款 AI 助手的前 20 名推荐列表两两之间的 Jaccard 相似系数仅在 0.33–0.54 之间,说明不同系统在本地推荐上彼此分歧明显。两周后重测,跨时段的答案相似度与同日重复查询相当,表明变动源于采样随机性而非时效漂移。

启示与意义

对餐饮与本地服务行业而言,研究传递出两个明确信号:

  • 想要被 AI 推荐,核心在于完善可被索引的结构化信息(网站、价格、第三方提及),而非单纯追求高分。
  • 即便产品口碑良好,也不一定会被任何 AI 系统选中;当前 AI 本地推荐的覆盖率仍非常有限。

对 AI 研究者与产品团队而言,该研究提供了一个可复现的全市场审计范式,未来可扩展到更多城市与品类,以更系统地衡量搜索增强型 AI 在本地场景下的实际表现与公平性。

信源