为智能体 AI 准备数据:五项属性与四条建设路径
文章指出 AI 智能体无法像人类一样判断数据正误,提出让数据本身具备可信、可追溯、可治理等五项属性,才能支撑智能体可靠执…
围绕智能体(agentic AI)的讨论大多聚焦框架、编排模式与协议,但如果数据层没有准备好,这些上层工作几乎无法真正产生价值。任何智能体在给出有用结果之前,所读取的数据必须达到机器可以直接消费、信任并据此行动的标准。文章从这个前提出发,讨论什么样的数据才能让智能体 AI 真正发挥效用。
数据的消费者正在改变
过去三十多年,数据系统的设计对象始终是人。仪表板、报表、分析师查询,都围绕坐在屏幕前的人展开,并且工作得不错,因为人自带大量隐式上下文,也会主动向同事追问缺失的信息。一位人类分析师天然知道公司里「营收」具体指什么、应该查哪些表、避开哪些表,也能在数字看起来不对、合计数过于整齐、日期落在节假日或价格低得不合理时本能地察觉。
智能体则不具备这些能力。它无法依赖多年积累的部落知识与模式识别,必须依赖被显式表达的上下文、实时可访问的数据源,以及稳定可信的质量。最关键的差异在于:当数据看起来「不对」时,人会停下来再核对一次,而智能体会毫不犹豫地按错误数据继续执行。整篇文章后续讨论正是建立在这个行为鸿沟之上。
「AI 就绪」现在意味着什么
面向人类消费者时,数据「差不多就行」,剩下的判断由分析师在脑中完成。一旦同样的数据交给智能体,所有这些隐式劳动都必须迁移到数据本身。文章把它拆成五项属性,每一项都对应过去由人类免费完成的工作:
- 可信(Trusted):人会怀疑不对劲的数字,智能体不会。必须把过去由人提供的「置信度」前置到数据层,让数据在智能体接触之前就经过准确性、新鲜度与有效性校验。
- 有上下文(Contextual):人知道「营收」已扣减退货、财年从二月开始;这些含义必须从人脑中显式写入数据。
- 可追溯(Traceable):人的决策事后可以解释,智能体 30 秒内的推理如果没有即时记录就会消失,必须能够回放它做了什么、为什么这么做。
- 可治理(Governed):人的访问受岗位与判断力约束,智能体的访问必须由设计限定,做到范围可控、可审计。
- 可执行(Operational):人看完仪表板后会去做事,智能体必须能自己「做事」,数据不仅要可读,还要可被调用与回写。
五项属性归结到同一个核心:它们都是过去人类无意识完成、现在要交给数据本身的职责。任何一项缺位,智能体都不会像人那样优雅降级,而是会以高度自信的方式失败。
四条建设路径
文章把五项属性的落地拆成四个主题,建议按以下顺序推进:
- 数据契约与质量(Data Contracts and Quality):让数据可信。优先解决,因为一条错误事实会污染其上所有层。
- 可追溯与治理(Traceability and Governance):记录智能体为何行动、限定它能触达的范围,对应可追溯与可治理。
- 上下文层(The context layer):把指标与实体的语义编码进数据,让数据具备上下文。
- 从可搜索到可执行(From Searchable to Actionable):让智能体能够查询实时系统并回写,使数据真正可执行。
按顺序走完四条路径,五项属性就不再是抽象目标,而成为可以被工程化的对象,把普通数据转化为 AI 就绪数据。
数据契约与质量:智能体闻不出坏数据
人有识别坏数据的直觉,会注意到数字异常、日期不合理或价格失真。智能体缺乏这种本能。正如 Simon Willison 所言,大语言模型「很容易上当」,它会相信被喂入的任何内容并据此行动。一旦向 AI 智能体传入错误的值,它不会犹豫,而是直接使用这个数字,给出错误却自信的回答。没有可信的数据,agentic AI 的其他环节都无从谈起,因此这是起点。
文章给出了一个典型场景:某定价智能体被询问产品 X 的当前价格。昨日价格已由 49.99 美元更新为 59.99 美元,但智能体的数据源尚未刷新,仍显示旧值。智能体不会迟疑,它取出 49.99 美元报给客户,客户下单,公司每单亏损 10 美元。智能体的每一步操作都「技术正确」,工作流执行完美,问题出在它所读取的数据上。
相比之下,人类销售员会停顿一下:「等等,我们上周不是改过价吗?」然后再次核对,依赖机构记忆与异常感觉。智能体两者皆无:错误不会触发警告,而是悄无声息地沿着工作流扩散。文章提到,在 Precisely 与德雷克塞尔大学 LeBow 商学院联合发布的《2026 年数据完整性与 AI 就绪度报告》中,受访的 505 名数据与分析从业者普遍把数据就绪度视为最大障碍——而越是自信数据已 AI 就绪的领导者,反而越把数据就绪列为首要瓶颈。
