Humans& 发布 Persimmon:面向多用户对话的人类行为模拟模型
Humans& 发布 Persimmon 用户模型,用于模拟多轮多人群聊中的真实人类行为分布,并在 Multi-User…
AI 研究团队 Humans& 近日发布了一款名为 Persimmon 的大规模「用户模型」(user model),专门用于在多轮、多人对话场景中模拟真实人类的行为。与常见的聊天大模型不同,Persimmon 的目标不是给出「最优回复」,而是在统计意义上复现人类回复的多样性与分布——既覆盖同一个人在不同情境下的差异,也覆盖不同人之间的差异。团队认为,前沿大模型的输出范围远比真实人类窄,若用它们来模拟用户,会显著收窄评估与环境研究所能覆盖的行为空间。
模型定位与发布形式
Persimmon 以研究预览(research preview)形式发布,同时开放 playground 与 API,供研究者调用。输入端接收一段交互场景描述以及若干模拟用户的「人设」配置,模型据此生成后续对话。该模型被设计用来:
- 探索个体与群体在不同情境下可能的发展路径;
- 评估不同决策、环境对人的长期影响;
- 训练 AI 去理解人类视角,并推演自身行为对人产生的作用。
评测方法:分布匹配
Persimmon 的核心主张是「用户模型应匹配人类行为的整体分布,而非追求单一最佳行为」。因此团队绕开以任务完成度为主的传统基准,采用「分布匹配」(distribution matching)思路来评估模型:让一个 LLM 裁判(judge)区分一段对话究竟是真人写的还是模型生成的,看模型能否「骗过」裁判。
基于这一思路,团队设计了 Multi-User Turing Test:裁判拿到若干组「真人组群对话」与「AI 组群对话」的样本,需要判断每组样本的来源。随机猜测的基线正确率是 50%,若模型与真人完全不可区分,裁判正确率应回落到 50%。通过增加生成回复数(k 值)与延长交互时间,可逐步提升测试难度。
关键基准结果
团队在三个数据集上进行了评测:TIDES、TutorMoments 与 Internal Workspace Conversations。在 k = 8 的设置下,Persimmon 让裁判「被骗」的比例显著高于所有对比模型:
- TIDES:Persimmon 21.1% ± 0.63 pp;Nemotron Ultra Base 2.7%;Opus 0.11%;GPT 5.6 0.11%;GPT 6 (Astra) 0%;Fable 5 0%;Kimi K3 0%;GLM 5.3 0%;OSim 8B 0%。
- Internal Workspace Conversations:Persimmon 18.6% ± 1.84 pp;GPT 5.6 0.89%;Nemotron Ultra Base 0.78%;Fable 5 0.44%;Kimi K3 0.44%;GPT 6 (Astra) 0.28%;Opus 0.28%;GLM 5.3 约 0.11%。
从绝对数字看,21% 的「被骗率」离 50% 的理论上限仍有相当距离,但相对于其他通用模型几乎归零的表现,Persimmon 已经把仿真人类行为的多样性显著向前推进了一档。
意义与待观察的问题
Persimmon 的意义在于把「用户仿真」从单一最佳回复的范式,转向显式建模人类行为的分布。这对以下方向尤为重要:智能体(agent)强化学习中的真实用户环境、社会模拟研究、以及红队/对齐评估中需要覆盖更广人群的场景。不过,团队在公告中尚未披露模型规模、训练数据构成与许可协议等关键细节,目前以 API 与 playground 的形式开放访问,后续开放范围与商用许可仍有待观察。
