研究论文
LLM 辅助因果发现:提出概率依赖图融合新表示
研究提出「概率依赖图」,把贝叶斯网络结构学习与 LLM 因果知识以概率形式融合,在 26 个基准上取得统计显著的 F1…
2026.08.31 · 周一约 2 分钟阅读
背景与动机
从观测数据中学习贝叶斯网络结构(BNSL)长期面临边方向不可识别的问题,而大语言模型(LLM)虽携带广泛的因果知识,却常常不可靠。来自 arXiv 的最新论文《LLM-Augmented Causal Discovery: Probabilistic Fusion of Edge Existence and Orientation》尝试把这两类互补信号结合起来,以提升因果图重建质量。
方法:概率依赖图
作者提出一种新的概率表示,称为 Probabilistic Dependency Graphs(PDG)。在 PDG 中,每条边对应一个关于「有向、无向、不存在」三类状态的分布,从而支持两类信号通过加权平均进行融合。具体的工程实现上,研究者把三种传统 BNSL 算法(FGES、Tabu、PC)与三种主流 LLM(Gemini、Claude、GPT)组合,并在多种 prompt 与随机种子下取整体表现。
实验结果
研究在 26 个基准网络上进行了系统评测,几个关键数字值得注意:
- 在 22 / 26 的网络上,简单的 50 / 50 融合策略即带来 F1 相对于两类信号中「更优者」的进一步提升;
- 平均 F1 提升为 0.056,统计显著性达到 p < 0.001;
- 两个来源呈现明确互补:BNSL 提供高召回的边骨架(80% vs LLM 的 60%),而 LLM 提供更准确的边方向(96% vs BNSL 的 77%)。
意义与启示
论文的核心结论是:把 BNSL 和 LLM 都表示为「边存在与方向上的概率不确定性」,是一种既实用又有效提升因果图准确率的方式。该工作一方面印证了 LLM 作为先验知识源的可用性,另一方面也提醒业界——传统结构学习在高召回上的优势仍不可替代。后续研究可以探索更精细的融合权重、prompt 设计,以及在更大规模、含噪声真实数据上的表现。
