2026 年三种搜索范式并存:关键词、RAG 与对话式大模型
文章解析关键词、RAG 与纯对话 LLM 三种搜索架构的原理、失败模式与各自的优化单元,并给出面向 LLM 的站点结构化…
在 2026 年的 Web 生态中,关键词搜索、RAG 检索增强生成以及纯对话式大模型三种搜索范式并行存在,它们并非简单的迭代取代关系,而是拥有不同架构、不同优化目标和不同失败模式的独立范式。对于建站者和内容生产者而言,理解这三者的差异至关重要。
范式一:关键词与倒排索引
经典 Google 搜索建立在三大组件之上:爬取、倒排索引与排序。
- 爬取:Googlebot 沿链接访问页面,下载内容并交由解析器处理。
- 倒排索引:内容被分词、词干化后建立索引结构,将每个词映射到包含它的文档集合(含位置与频次)。其结构与"文档 → 词"的常规索引相反,是"词 → 文档"。
- 排序:最初的 PageRank 是一种迭代算法,依据指向页面的链接分数加权求和来给页面打分。如今排序已极为复杂——包含数百种信号、用于查询理解的神经模型以及个性化机制——但倒排索引仍是基础结构。
该范式的结构性问题是:模型优化的是查询词与文档词的匹配,而非意图理解。它无法识别"食品级硅胶垫片供应商 博洛尼亚"与"在艾米利亚-罗马涅大区哪里能买到食品级 O 形圈"其实是同一个问题。同义词扩展、查询扩展与实体识别等部分方案能提升召回率,但无法解决根本问题——它是统计匹配,而非语义理解。
范式二:检索增强生成(RAG)与 AI Overview
Google 的 AI Overview 以及 Perplexity 等回答引擎采用 RAG 架构:查询 → 检索(倒排索引或向量索引)→ top-k 文档 → LLM → 合成答案。检索阶段拉取最相关的文档,大模型阅读后生成整合多源信息的自然语言回答。
相较关键词模型,RAG 的优势在于:答案为自然语言形式,可整合多源信息,更擅长处理复杂查询。但它也存在若干结构性问题:
- 检索质量:若检索返回错误文档,LLM 会以高置信度输出错误答案——典型的"垃圾进、垃圾出",只是包装得更有说服力。
- 部分接地:即便检索文档不含某信息,LLM 仍可能用训练知识补全,导致答案混合了已验证事实与未声明的推断。
- 不透明性:用户无法分辨答案哪些来自检索文档、哪些来自模型训练。引用标注有一定帮助,但覆盖面有限。
- 表征不对称:文本内容丰富的站点更易被检索;具备丰富语义结构但文本稀疏的站点(例如使用扩展 JSON-LD 与 llms.txt 的站点)在传统检索中处于弱势。
范式三:不带 RAG 的纯对话式大模型
当用户使用 ChatGPT、Claude 或 Gemini 的纯对话模式(无主动联网搜索)时,模型完全基于训练数据作答。
训练阶段,模型在大规模文本语料上以"下一词预测"为目标进行训练,过程中学习实体的分布式表征以及实体间关系。它并非机械记忆事实,而是学习词元上的概率分布。
幻觉之所以在结构上不可避免:模型并不区分"我知道 X 为真"与"在给定上下文下 X 概率较高"。当训练数据中某实体稀疏时,模型会用看似合理的概率推断填补空白。一家线上存在感薄弱的意大利制造型 SME 就是一个天然稀疏实体——模型是在推断,而非回忆。
分布密度决定表征精度:在训练语料中被多次、一致提及的实体,模型对其表征更精确;被罕见提及或提及不一致的实体,则容易产生幻觉。这就是大公司在模型中被表征得更好的原因——并非因为它们更"优秀",而是因为它们在语料中具有更大的语义质量(semantic mass)。
核心差异:优化单元
三种范式的根本区别在于优化对象:
- 关键词模型:优化词元——关注关键词密度与外链建设,使用 Google Search Console、Ahrefs 等工具。
- RAG 模型:优化文档——使其可被检索并被引用,关注结构化数据与可引用性。
- 对话式 LLM:优化实体——确保模型对自身数字身份有精确且可验证的表征,关注 llms.txt、JSON-LD @graph、schema.org 等。
工程落地:llms.txt 与 JSON-LD
当优化对象变为实体时,技术问题转化为:如何表征一个实体,才能让 LLM 正确理解它?
llms.txt 是放置在域名根目录的结构化文本文件,向模型提供关于站点身份的明确上下文——产品、服务、能力和实体关系。它不会被 Google 以传统方式索引,但会被 AI 爬虫(如 GPTBot、ClaudeBot、PerplexityBot)读取,并作为主要上下文来源。
规范本身简单:使用 Markdown 二级标题分节、链接至主要资源、描述简短精确。一份有效的 llms.txt 与无效版本之间的差距不在长度,而在表述精度与歧义消除程度。llms-full.txt 是其扩展版本,提供更完整的内容以便模型建立更深层次的实体理解。
三种范式并存的现实意味着,建站者不能再只针对 Google 关键词排序优化,而必须同时考虑文档的可检索性以及实体在训练语料中的语义质量——后者本质上要求站点以机器可读、可验证的方式"声明自身"。
