桃子桃子快讯
返回首页
研究论文

Pathway 提出 AI 推理公理化框架

Pathway AI 在 BDH 论文中提出「推理方程」,试图为大模型构建类似热力学的理论公理基础。

2026.08.19 · 周三3 分钟阅读

AI 公司 Pathway 发表博客文章,正式介绍其「The Equations of Reasoning」研究框架。该工作源自其 BDH 论文,试图为大模型推理建立类似热力学的微观公理化基础,让研究人员无需逐一重新训练就能从理论上推演系统的能力、稳定性与失效边界。

把当前 AI 比作「热力学出现前的蒸汽机」

文章将当前 AI 的发展状态类比为热机工程在卡诺循环出现之前的阶段:工程上已经能造出越来越高效的引擎,也能比较油耗,却缺乏解释所有设计共有上限的通用法则。Pathway 认为,当下的 AI 也是如此——我们可以观察效果良好的系统、测量 benchmark 表现、不断把规模做大,但缺少统一的理论来解释模型在训练分布之外的行为为何如此,更无法预测其在陌生条件下的表现。

作者回顾了过去近十年深度学习的演进路径:更大的模型、更多的数据、更强的算力几乎总会带来更好的结果;2017 年提出的 Transformer 架构天然适配 GPU 上的大规模矩阵运算,因此在「硬件彩票」中胜出,并主导了整个领域朝「暴力缩放」的方向发展。这种范式更多依赖经验规律,而非能够揭示「为什么」的统一原理。

BDH 论文:把推理写成局部动力学

为填补这一空白,Pathway 介绍了 BDH 论文中提出的「推理方程」。该工作的核心目标是为 Transformer 类推理建立正式的微观基础,在「快速权重与注意力机制」与「局部突触动力学」之间架起严格的数学桥梁。具体而言:

  • 推理过程被表达为一系列显式的局部操作:哪些神经元被激活、信息如何在系统中传递、突触状态如何更新以编码注意力与记忆;
  • 把推理写成局部动力学后,长期行为、持续适应、模型组合等问题都被纳入可进行数学分析的范畴;
  • 系统在部署之前,其能力边界、稳定区间、失效模式就有可能被解析地刻画出来。

理论愿景:让安全成为可设计属性

文章进一步阐述了这一框架的实践意义。作者认为,如果推理行为可由方程推导,AI 系统的稳定性与失效模式就可能在部署之前被分析和工程化处理,安全性将从「部署后再评估」转变为「可预先设计的属性」。

与此同时,文章也承认现有经验范式的不可替代价值:

  • 损失函数回答了「训练奖励了什么」;
  • 梯度流描述了参数如何变化;
  • Scaling law 总结了性能随数据、算力、模型规模变化的趋势;
  • 可解释性实验可以在特定模型中识别机制。

但这些工具都无法回答:在何种条件下模型的可预测性会崩溃?推理时间延长后计算是否仍稳定?局部操作如何涌现出整体智能?

待检验的设想

文章最后呼吁,未来需要的是一组能够暴露不变量的「公理」,而不是又一份 benchmark 排行榜;这与热力学为所有引擎设定效率上限的思路异曲同工。然而,「推理方程」目前仍处于理论提出阶段。文章并未给出在方程框架下对实际模型的预测验证,也未与传统注意力机制进行系统性定量对比。其能否真正成为下一代 AI 工程的理论基础,仍有待学术界和工业界的进一步检验。

信源