桃子桃子快讯
返回首页
研究论文

新论文提出 DCGS 框架:利用对话历史推断用户意图以增强多轮对话安全

一篇 arXiv 论文提出 Dialogue Critic Guided Sampling 框架,通过建模为 MDP 并…

2026.07.24 · 周五2 分钟阅读

arXiv 上发表的一篇论文《Robust Critics: Defending LLMs Against Multi-Turn Attacks》提出了一种名为 Dialogue Critic Guided Sampling(DCGS)的新框架,专门用于在多轮对话场景下提升大语言模型(LLM)的安全性。该工作针对 LLM 安全中的一个核心难题——用户意图的模糊性——展开:当用户提问触及敏感话题时,模型难以判断这是真正的攻击还是被误解的善意提问;而在多轮对话中,攻击者的真实意图往往在多次交互后才逐步显现。

核心思路:把多轮对话建模为马尔可夫决策过程

现有安全框架大多采用 contextual bandit 的处理方式,只考虑当前轮的上下文,忽略整段对话的轨迹。DCGS 则将对抗性对话建模为马尔可夫决策过程(MDP),在每一轮基于完整的对话历史推断用户意图,并据此生成回复。论文提出了在 token 级和 utterance(完整回复)级两个粒度上学习价值与遗憾(regret)评论器,并通过动作价值评论器对候选回复进行打分。

作者在理论上证明,这种推理时的重加权近似于对基础策略的指数倾斜(exponential tilting),对于任意有限的候选回复集合都能保证期望回报的改进——这是 group-relative 目标所不具备的性质。

实验:在多个对抗基准上验证有效

研究团队在四个主流对抗性对话基准上对 DCGS 进行了评估:

  • CARES-18k
  • WildJailbreak
  • Redbench
  • Harmbench

实验结果显示,DCGS 在这些对抗性对话任务上均优于多个强鲁棒性基线模型以及部分前沿模型。值得注意的是,DCGS 具备迁移能力——无需微调即可提升前沿模型在对抗场景下的鲁棒性,这意味着该方法可以作为一种即插即用的安全增强手段。

意义与局限

多轮对话攻击是当前 LLM 安全领域的重要挑战之一,DCGS 提供了一种从对话轨迹层面推断意图的新视角,并通过理论保证和跨基准验证了其有效性。不过,作为一篇研究论文,其方法的实际部署成本、在超长对话场景下的可扩展性,以及与现有 RLHF / 对齐方案的兼容性,仍有待进一步验证。

信源