信息架构:被 AI 时代忽视的基础设施
文章指出 RAG 系统的幻觉与错误回答根源在于内容缺乏信息架构,呼吁企业重视分类法、元数据与受控词表等基础工作。
当大模型从演示走向生产环境,幻觉、错误回答与检索失效几乎成为每个团队的共同困扰。文章作者认为,这些问题的根源往往不在模型本身,而在于被长期忽视的信息架构(Information Architecture,IA)——即企业从未为内容建立统一的命名、分类与组织方式。在 AI 出现之前,这种混乱只是让访客感到困惑;而在 RAG 与智能体成为产品核心之后,同样的混乱被放大成可量化、可重复、可计费的故障。
IA 从边缘走到台前
作者回顾了过去二十年信息架构的处境:岗位消失、预算被砍、与产品迭代争夺资源时屡屡落败。AI 的到来改变了这一平衡。2025 年的多项行业调查将「数据质量与可获得性」列为 AI 落地的首要障碍,超过算法、合规与算力等因素。换言之,AI 把原本隐性的内容治理问题推到了损益表上。
- 同样的内容混乱,过去只导致访客迷路,现在直接造成模型幻觉与错误答案。
- 「错的内容」会以 token 计费的方式被反复检索、反复生成。
- 再先进的模型、再精细的提示工程,也无法弥补底层内容的无序。
检索的质量取决于起点
文章将矛头对准 RAG 的常见假设:把模型指向内容库,让它自行检索相关段落并生成回答。作者指出,这一机制继承了内容库的所有缺陷。当内容是扁平、无标签、自相矛盾的文档堆时,检索只能找到「最响亮」的那篇——即与查询共享最多表面词汇的文本,而不论其是否最新、最权威、最准确。
信息架构的作用就是让「正确的那个」成为可被识别的存在。组织方式、标签与导航不是装饰,而是检索系统能否找到正确答案的前提。模型无法越过结构去思考;如果没有结构,它只会抓取最近的文档。
结构让模型理解「这是什么」
一段价格、一条政策、一则过期说明、一段客户引言,在文本表面可能读起来几乎相同,但含义截然相反。人类读者可以通过上下文快速区分,模型却只能看到「四段看似合理的文字」,缺乏判断其权威性、时效性与官方性的依据。
解决这一问题的关键正是 IA 领域长期研究的对象:分类法(taxonomy)、本体(ontology)与语义层(semantic layer)。文章将其统称为「语义层」——位于原始内容与读取它的系统之间的、受治理的定义、类型与关系集合。其中两个机制承担主要工作:
- 受控词表(Controlled Vocabularies):为同一概念锁定固定术语,避免「取消」「终止」「关闭」等近义词被系统视作四个无关概念。
- 结构化元数据:通过标签与字段标注内容的时效性、权威性与关系,为检索提供超越原始文本的推理依据。
这一思路同样适用于查询侧:在用户问题到达检索之前,先将「退款」「退钱」「返款」等不同表述映射到内容归档时使用的标准术语,使查询与内容库使用同一套受控语言进行匹配。
AI 时代的 IA 补课
文章的结论指向一个朴素的判断:在为 AI 支付算力与模型费用之前,企业需要先为内容付费一次——把它整理好。对于正在推进 RAG、知识库或智能体落地的团队而言,这篇文章提供了一个值得认真对待的提醒:模型再强,也读不懂一个从未被组织过的文档堆。
