研究论文
深度 RL 策略变可读逻辑:Prolog 可执行专家系统新方法
arXiv 新论文提出三阶段后处理方法,将深度强化学习策略转换为可读、可执行、可编辑的 Prolog 程序,并给出四项理…
2026.07.20 · 周一约 3 分钟阅读
arXiv 上的一篇新论文提出了一个三阶段后处理流程,旨在把训练好的深度强化学习(RL)策略从「黑盒」转换为人类可读、逻辑引擎可执行、优化器可编辑的 Prolog 程序,从而为 RL 策略提供可解释性。论文同时给出了四项理论保证与在多个标准控制任务上的实验结果。
核心思路:三阶段转换
论文的整体框架包含以下步骤:
- 第一阶段:冻结一个采用近端策略优化(PPO)训练得到的教师网络,确保其行为可复现。
- 第二阶段:以经典关系学习(relational learning)的方式,从教师网络的决策中归纳出一个有序规则列表(ordered rule list)。
- 第三阶段:将该规则列表输出为一份 Prolog 程序,每一条决策都由现成的逻辑引擎执行。
- 后续还有一个「扩展阶段」:编辑规则库时,只有当策略评估证明能带来回报提升时,该编辑才会被接受。
作者将这一流程定位为「后处理」(post-hoc)的转换,不要求重新训练原策略。
理论保证
论文证明的四项关键性质包括:
- 在有限马尔可夫决策过程(MDP)中,蒸馏得到的程序是一份「机器可校验的证书」(machine-checkable certificate),并给出回报损失上界。
- 扩展循环单调改进且必然终止。
- 在连续观测设置下,作者证明:随着阈值分辨率 B 增大,命题阈值实例化(propositional threshold instantiation)可以以任意精度逼近网络决策,误差按 O(1/B) 收敛,回报差距以相同速率闭合。
- 与此同时,一个匹配的复杂度下界表明:当决策边界为斜向(oblique)时,转换成本随观测维度呈指数增长。
这一下界解释了论文在更精细控制任务上观察到的性能上限。
实验结果
论文在多个控制基准上进行了验证,关键数据如下:
- 两房间钥匙-门任务(two-room key-and-door):可达状态 16,944 个;扩展后的 Prolog 程序在所有随机种子上取得精确最优回报;在预算受限的设定下,10 个种子中有 10 个在精确回报指标上超过随机性教师。
- Acrobot(连续控制):转换所得程序以 11 条子句(clauses)在噪声范围内匹配神经教师的回报。
- CartPole:恢复神经教师约 97% 的回报。
- LunarLander(更精细控制):仅部分恢复回报,论文指出这正是其指数下界所预测的天花板。
意义与边界
该工作的价值在于为深度 RL 策略提供了一种形式化的可解释路径:以 Prolog 这种成熟逻辑语言承载策略,使决策既可被人阅读,也可被逻辑引擎执行,还能在保持性能的前提下被受控编辑。四项理论保证——尤其是回报损失上界与扩展阶段的单调终止性——使结果可被机器校验。然而,连续高维观测下的指数复杂度下界也明确划定了该方法的适用边界:对于斜向决策边界的高维任务,逐条规则化的代价仍然很高,这解释了 LunarLander 上仅能部分恢复回报的现象。
