桃子桃子快讯
返回首页
研究论文

ReAdapt 框架提升 LLM 智能体社交关系推理

arXiv 提出 ReAdapt 框架与社交关系基准,将 LLM 智能体关系推理准确率提升 8–14 个百分点。

2026.09.23 · 周三3 分钟阅读

LLM 智能体在面对「是否回应这条动态」「该找谁做引荐」这类基础社交决策时,常常只被表面内容所吸引,而忽略人物之间潜在的关系线索——亲疏、互惠、共同好友等。当内容层面的显著性与关系层面的真实最优解发生冲突时,智能体容易做出表面合理、关系上却错误的判断。arXiv 上的一项新研究对这一失效模式进行了形式化刻画,并提出了对应的改进框架 ReAdapt。

研究背景:表面合理不等于关系正确

社交决策的核心往往不在于「哪条内容最显眼」,而在于「人与人之间的关系结构」。标准 LLM Agent 循环(典型代表是 ReAct)并没有显式地建模「新出现的关系证据应当如何修订智能体当前对社交情境的假设」,因此在关系线索与内容线索背离时,更倾向于选择表面显著的候选。

关系推理基准

为定量刻画这一失效模式,研究者构建了一个关系推理基准,包含:

  • 500 个合成社交世界,每个世界包含好友关系、关注关系、互动历史与信息流
  • 共 1000 条查询,覆盖两个任务:reaction selection(反应选择)与 warm introduction(暖介绍,即寻找通往目标人物的最佳桥梁节点)
  • 约 53% 的查询中,"表面最合理"的候选与"关系最优"的标准答案不一致,构成 overturn 子集

在这 53% 的 overturn 案例里,智能体必须主动调用关系证据来推翻一个初始看上去合理的判断。

ReAdapt 方法概览

ReAdapt(Relationship-Adaptive Agent with Policy-driven sTate)在 ReAct 循环基础上,引入一个显式的结构化社交状态 z = (G, B, R, N, D),分别编码:

  • G:目标(goal)
  • B:信念(belief)
  • R:关系(relationship)
  • N:规范(norm)
  • D:披露(disclosure)

每一次工具观测之后,ReAdapt 会执行一次类型化的 Adapt 步骤,根据新证据更新上述状态,并发出一项策略操作(continue / switch / abandon / clarify),再据此选择下一步动作。换言之,它把"该不该改主意"这件事本身变成了一个受类型约束、可解释的状态更新过程。

实验结果

研究者以 Gemini-3-Flash 为底层模型、在两个任务各 150 条分层抽样查询上做了对比,主要结果如下:

  • 暖介绍准确率:从 37% 提升至 51%(+14 个百分点)
  • 反应选择准确率:从 69% 提升至 77%(+8 个百分点)
  • 对应的 oracle regret 分别从 0.260 降至 0.152、从 0.095 降至 0.053

在固定模型、工具与环境的前提下,作者认为这一提升来自显式的关系状态建模本身——它让检索到的社交证据能够被结构化地转化为对原决策的修订,而非被湮没在下一轮推理中。该工作把"社交智能体是否真的理解关系"这件事,从经验性抱怨变成了一个可量化、可对照测试的研究问题。

信源