桃子桃子快讯
返回首页
研究论文

深度 RL 策略变可读逻辑:Prolog 可执行专家系统新方法

arXiv 新论文提出三阶段后处理方法,将深度强化学习策略转换为可读、可执行、可编辑的 Prolog 程序,并给出四项理…

2026.07.20 · 周一3 分钟阅读

arXiv 上的一篇新论文提出了一个三阶段后处理流程,旨在把训练好的深度强化学习(RL)策略从「黑盒」转换为人类可读、逻辑引擎可执行、优化器可编辑的 Prolog 程序,从而为 RL 策略提供可解释性。论文同时给出了四项理论保证与在多个标准控制任务上的实验结果。

核心思路:三阶段转换

论文的整体框架包含以下步骤:

  • 第一阶段:冻结一个采用近端策略优化(PPO)训练得到的教师网络,确保其行为可复现。
  • 第二阶段:以经典关系学习(relational learning)的方式,从教师网络的决策中归纳出一个有序规则列表(ordered rule list)。
  • 第三阶段:将该规则列表输出为一份 Prolog 程序,每一条决策都由现成的逻辑引擎执行。
  • 后续还有一个「扩展阶段」:编辑规则库时,只有当策略评估证明能带来回报提升时,该编辑才会被接受。

作者将这一流程定位为「后处理」(post-hoc)的转换,不要求重新训练原策略。

理论保证

论文证明的四项关键性质包括:

  • 在有限马尔可夫决策过程(MDP)中,蒸馏得到的程序是一份「机器可校验的证书」(machine-checkable certificate),并给出回报损失上界。
  • 扩展循环单调改进且必然终止。
  • 在连续观测设置下,作者证明:随着阈值分辨率 B 增大,命题阈值实例化(propositional threshold instantiation)可以以任意精度逼近网络决策,误差按 O(1/B) 收敛,回报差距以相同速率闭合。
  • 与此同时,一个匹配的复杂度下界表明:当决策边界为斜向(oblique)时,转换成本随观测维度呈指数增长。

这一下界解释了论文在更精细控制任务上观察到的性能上限。

实验结果

论文在多个控制基准上进行了验证,关键数据如下:

  • 两房间钥匙-门任务(two-room key-and-door):可达状态 16,944 个;扩展后的 Prolog 程序在所有随机种子上取得精确最优回报;在预算受限的设定下,10 个种子中有 10 个在精确回报指标上超过随机性教师。
  • Acrobot(连续控制):转换所得程序以 11 条子句(clauses)在噪声范围内匹配神经教师的回报。
  • CartPole:恢复神经教师约 97% 的回报。
  • LunarLander(更精细控制):仅部分恢复回报,论文指出这正是其指数下界所预测的天花板。

意义与边界

该工作的价值在于为深度 RL 策略提供了一种形式化的可解释路径:以 Prolog 这种成熟逻辑语言承载策略,使决策既可被人阅读,也可被逻辑引擎执行,还能在保持性能的前提下被受控编辑。四项理论保证——尤其是回报损失上界与扩展阶段的单调终止性——使结果可被机器校验。然而,连续高维观测下的指数复杂度下界也明确划定了该方法的适用边界:对于斜向决策边界的高维任务,逐条规则化的代价仍然很高,这解释了 LunarLander 上仅能部分恢复回报的现象。

信源