桃子桃子快讯
返回首页
研究论文

企业数据 Agent 新框架:以潜等价学习拆解证据组织与语义推理

arXiv 新文提出 latent equivalence learning 框架,将持久身份与数据集相关表征解耦,在…

2026.09.23 · 周三3 分钟阅读

arXiv 上一篇新论文《Learned Enterprise Data Comprehension: Compression and Routing for Data Agents》提出了一种面向企业结构化数据 Agent 的学习框架,试图用「潜等价学习(latent equivalence learning)」把智能体擅长的语义推理与学习型系统擅长的结构预测分开处理。该工作在 Data Agent Benchmark 上以 94.67% 的 Pass@1 排名第一,显著高于 Claude Opus 4.6 参考智能体 55.51% 的成绩。

研究背景

企业环境中的结构化数据 Agent 需要同时理解表结构、字段关系、业务策略以及反复出现的业务角色,相关信息往往分散在多个数据源中。现有智能体系统通常借助可复用的 markdown 风格记忆或技能文件来缓存已发现的信息,以减少重复探测,但这种方式将语义推理与结构预测混在一起,并没有清晰的分工。论文认为,二者本质上适合不同的处理范式:智能体适合做语义推理,学习型系统则更适合预测并组织反复出现的结构。

方法概述

论文引入 latent equivalence learning 框架,核心思想是将「持久任务相关身份」与其在特定数据集中的「相对实例化」相分离。

  • 支持与反对证据共同塑造「支持实现的高斯原型(support-realized Gaussian prototypes)」,用于学习这些身份在特定数据环境中如何被表达;
  • 「软成员度配置(soft-membership profiles)」保留在硬分配下被丢失的区分度;
  • 独立的查询原型系统表示反复出现的证据需求,并通过一个可学习的兼容函数映射到同一持久身份结构中。

最终,这种「按身份分解、按查询条件路由」的方式会在推理前就把与当前查询相关的、数据集特定的证据准备好,让 Agent 在已经组织好的证据状态上工作,而不是每次查询都重建跨表结构。

实验结果

论文在 Data Agent Benchmark 上评估,该基准覆盖 12 个异构数据集、共计 54 条查询。结果显示:

  • 完整实现五次完整试验后取得 94.67% 的数据集宏观分层 Pass@1;
  • 原始查询层面成功 258/270 次;
  • 同期 Claude Opus 4.6 参考 Agent 为 55.51%;
  • 提交时在 40 个排行榜条目中排名第一。

意义与展望

论文展示了一种将学习型结构预测与生成式语义推理显式解耦的思路,对于在企业级多源结构化数据上构建 Agent 提供了可参考的架构方向。不过,目前评估仍集中在单一基准,框架在不同行业数据、不同治理策略下的泛化表现,以及与现有 RAG / 微调方案的工程对比,仍有待进一步验证。

信源