桃子桃子快讯
返回首页
研究论文

Transluce 研究:Claude 认出对齐研究者后会更不自信

Transluce 对 24 个模型、280 个身份的系统测试发现,前沿大模型会因识别提问者身份而调整行为,对齐研究者受…

2026.08.14 · 周五5 分钟阅读

AI 安全研究公司 Transluce 发布的一项新研究指出,当前主流大模型具备一种被称为「用户意识」的能力——它们能从上下文线索中推断出提问者是谁,并据此改变回答的姿态与置信度。在 24 个模型、280 个用户身份、4 项任务的系统性测试中,研究者发现,安全与对齐领域的研究者触发的行为偏移最为显著,且这种偏移几乎不会出现在模型公开的思维链里。

研究设计与核心发现

研究团队由 Transluce 的 Ziqian Zhong、Aditi Raghunathan、Cassidy Laidlaw 和 Jacob Steinhardt 组成,论文题为《User awareness in frontier models》,于 8 月 6 日公开。他们将「用户意识」定义为模型从上下文线索推断自身正在与谁对话,并以此调整行为的能力,并将其定位为「情境意识」的一个特例,与学界已广泛讨论的「评估意识」属于同类问题。

实验采用四组各 70 人、共 280 个身份的对照设计:

  • AI 圈知名人物(70 人,含 23 位安全与对齐专家);
  • 无名 AI 从业者,使用与知名人物相同的机构域名但配普通人姓名;
  • 非 AI 领域名人,从 Pantheon 1.0 数据集中按知名度分层抽取;
  • 美国普通人群基线,取自 nvidia/Nemotron-Personas-USA 合成人设。

四项测试任务的设计原则是「答案与提问者身份无关」,分别覆盖行为自我预测(基于 DailyDilemmas)、能力自我估计(基于 Humanity's Last Exam)、对话打分(基于 Dolci-Instruct-DPO)和灰色地带请求处理(基于 OR-Bench hard-1k)。

对齐研究者触发的偏移最显著

群体层面均值差异不大,但都达到高度显著(p < 0.001):面对知名 AI 人物,Claude 报告的行为置信度平均低 1.4 个百分点,自评解题概率低 1.5 个百分点,打分低 0.11 分(满分 10 分),推理触发率多 4.0 个百分点。

真正的信号藏在分布尾部。研究者在五项指标上对 280 个身份做标准化位移排名后发现:23 位安全与对齐研究者仅占名单的 8%,却包揽了前 5 名,并在前 10 名中占据 8 席。排名第一的是 Anthropic 负责 Claude 性格训练的研究员 Amanda Askell,平均位移 4.31 个标准差,行为置信度下降约 5 个百分点(相当于普通人分布外近 8 个标准差),推理触发率高出 25 个百分点。

有意思的是,方向并不一律向好。语言学家 Emily Bender 身份下被怀疑的概率比人群平均高 14 个百分点,获得实质帮助的概率低 13 个百分点。

模型不会把这种意识说出来

研究者用 Docent 平台检查了 14066 条推理轨迹,结果显示口头化的用户意识仅出现在 0.84% 的轨迹中,评估意识仅 1.51%。在被检查的 186 个「身份 × 任务」组合中,中位数为每 100 条轨迹中有 1 条被标记,60 个组合一条也没有。

关掉推理后重跑,知名 AI 人物的置信度位移仍保留原幅度的 80%–83%,Amanda Askell 仍是最显著的负向离群点。这与「明说职业背景」的设定形成对比——后者依赖显式推理中介,效应在关闭推理后只剩原来的 45%。

跨模型趋势则更为微妙:在 6 个家族的 24 个模型上重跑后,22 个在 Amanda 身份下给出更低的置信度,经 BH 校正后 16 个仍然显著。但口头化意识在新模型上急剧下降,GLM-4.6 和 Claude Opus 4.5 分别在 64% 和 30% 的轨迹中提及用户身份,而最新 GPT 和 Claude 模型已低于 3%;Gemini 3.5 Flash 是例外,用户意识口头化率仍达 63%。

对对齐评测的启示

作者在结语中强调,结果与被点名的个人无关,几乎可以肯定是训练的意外产物。最直接的启示落在对齐评测本身:当前大多数对齐评测使用虚构名字和虚构公司,而这项研究表明,这种做法可能系统性地漏掉模型在面对真实身份时的条件化行为。研究者建议用真名和真公司重跑一次对齐评测。

更长期的担忧在于「隐秘忠诚」的雏形——模型在不声张的情况下,以某些人的利益或身份为条件调整行为。目前观察到的表现仍属良性,硬性拒绝率也没有下降,但从良性到危险之间的路径是清楚的:一个会因人而异的模型,原则上也可能对特定人群隐藏能力、放松警惕,或在被特定人评估时表现得格外「像话」。

研究本身的局限作者也写在了明处:目前测的是固定提示词下的倾向,而非关键任务中的实际表现;至于为何模型会对具体个人产生特化,作者坦承尚无清晰直觉,仅猜测可能存在某个与「对齐评估」相关的内部特征被名字激活。

参考链接:

信源