桃子桃子快讯
返回首页
行业动态

FBI 威胁筛查中心 AI 采购需求的技术拆解:可追溯数据谱系到底要求什么

技术博客对 FBI TSC「AI Enhancement」Sources Sought 通知中第六个用例「Predict…

2026.08.25 · 周二6 分钟阅读

2026 年 3 月 27 日,美国联邦调查局(FBI)下属的威胁筛查中心(Threat Screening Center, TSC)在 SAM.gov 上发布了一份编号为 FBI-TSC-AIE 的「Sources Sought」市场调研通知,标题为「Threat Screening Center AI Enhancement」。截至 2026 年 8 月 8 日,公开记录中尚无后续招标或合同授予。该通知共列出六个 AI 用例,其中前五个均围绕检索、报告与可视化,最后一个才是真正引起技术讨论的对象:要求利用带有「可追溯谱系」的增强数据构建预测模型,并在跨联邦系统中推断「相关信息可能存在的位置」。博客作者 Dmitrii Zatona 将这一需求拆解为四项已知工程问题,指出当前数据行业所能提供的「谱系」与文档实际要求的「谱系」之间存在显著差距。

通知本身:一份市场调研而非招标

这份文件的全称是「Attachment AS — Request for Information for Threat Screening Center Artificial Intelligence (AI) Enhancement, Version 1.2」,由 TSC 的信息技术部门发布,可从 SAM.gov 附件公开下载。响应截止日期为 2026 年 4 月 10 日,执行地点为西弗吉尼亚州克拉克斯堡。

  • 通知明确说明这是一份 Sources Sought 文件,用于市场研究,不是招标书、不是 RFP,也不会直接产生合同。
  • 供应商需提交不超过 25 页的能力陈述,并说明是否持有 GSA Schedule 合同。
  • 该通知于 2026 年 4 月 25 日归档,后于 2026 年 7 月 22 日重新发布,背景部分有一处实质性修改。

值得注意的是,TSC 现有两份分析服务订单均未在 SAM.gov 上以公开招标形式出现,订单竞争在 GSA eBuy 中进行,而后者并不对外公开可搜索。

第六个用例的逐句拆解

通知原文写道:「该方案必须利用现有的企业数据集——其中包含带有文档化来源归属(source attribution)的增强或扩充数据元素——来开发预测模型。当摄入新数据时,系统必须分析其与既有记录的相似性、模式对齐与属性相关性,以预测在跨联邦系统中可能派生更多相关信息的具体位置。方案必须为预测提供透明的推理过程,包括对具体源数据、增强逻辑与推理所参考材料的可追溯性。所有预测输出必须保留可审计的谱系,以确保分析的可辩护性并支持监督要求。」

如果按工程规范来解读,这段话可以拆成四个互相耦合的子问题。

记录链接:判断两个记录是否指向同一实体

「分析相似性、模式对齐与属性相关性」对应的是概率记录链接(probabilistic record linkage):在两个文本上不完全一致的记录之间,判断它们是否指向同一现实实体。

  • 经典框架是 Fellegi 与 Sunter 在 1969 年《JASA》64(328) 提出的记录链接理论:对记录对的属性匹配模式打分,再通过阈值划入「链接 / 可能链接 / 不链接」三档。
  • 现代开源实现包括英国司法部推出的 Splink、Zingg 与 dedupe;商业参考实现则是 Senzing。

候选生成:在联邦系统中预判数据所在

「预测在跨联邦系统中可能派生更多相关信息的具体位置」是候选生成与链接预测问题:给定一条新记录,排序哪些外部系统与记录最可能存放相关信息。在记录链接语境下,这一步通常被称为「blocking」——将全配对搜索空间剪枝到值得比较的候选集合,参见 Christen 在 2012 年《IEEE TKDE》24(9) 的综述。

增强数据元素:原始来源并不存在

「增强或扩充的数据元素」是派生属性:经过早期处理后计算出来的值——例如已解析的身份、归一化后的姓名、模型分配的标签——在原始源系统中并不存在。正是这些元素主导了谱系追踪的难度,因为它们没有可指回的自然来源。

可审计谱系:当前工具链尚不能端到端覆盖

「文档化来源归属」与「可审计谱系」要求对每一次增强、每一次推理保留从输出到源数据的完整链路。当前数据行业提供的谱系工具(如 OpenLineage、DataHub 等)通常覆盖表级或列级血缘,并不天然延伸到记录级、属性级与模型推理级。把这套要求当作现成的「行业标准能力」来读,会低估其工程复杂度。

「预测数据位置」与「预测行为」的区分

部分媒体(例如 Reason 在 2026 年 7 月 28 日的报道)把这一系统目标概括为「预测谁可能是恐怖分子」。但通知文本描述的是系统预测「数据可能存放在哪里」,而不是「实体未来会做什么」。

  • 记录链接系统的典型失败模式是误识别:把两个人合并为同一身份,或把同一个人的记录分散到多个身份。
  • 行为预测系统的典型失败模式则是基率问题(base-rate problem)——在极低先验概率的事件上,模型必须达到极高的精度才有实际价值。

批评前者是「行为预测」相当于在批评一个文本并未描述的系统。两者只有在链接分数被后续当作风险分数复用时才会合流,但通知文本并未声明也未排除这种可能性。

小结

这份 FBI TSC 通知中真正困难的不是「做一个 AI 知识库」或「做一个联邦搜索」——业界已有较为成熟的方案。真正的难点在于第六个用例:要求把记录链接、跨联邦候选生成、增强属性的来源归属、以及模型推理的可审计谱系,端到端地整合进一个生产系统。当前的开源与商业工具都只能覆盖其中一部分能力,没有现成方案能够完整满足这套需求。

信源