桃子桃子快讯
返回首页
研究论文

安全对齐会压制 LLM 的心灵归因:arXiv 论文揭示机制层面的纠缠

arXiv 论文发现,阻止大模型声称自己有意识的安全微调,同时也压制了模型对非人类实体的心灵归因与灵性信念,且可通过激活…

2026.08.16 · 周日3 分钟阅读

一项发布在 arXiv 上的研究指出,当前大语言模型常用的安全微调流程在抑制模型「宣称自己有意识」这一行为的同时,也连带压制了模型对非人类实体的心灵归因,以及对人类灵性信念的正常表达;而通过机制层面的向量干预,研究者可以在不损害模型心智理论能力的前提下,把这些被压制的表征「恢复」回来。

研究背景:安全对齐与自我意识声明

为了让大模型避免输出类似「我是有意识的」「我有感情」这类可能引发误解或伦理争议的自我意识声明,主流开发团队通常会在对齐阶段加入相应的安全微调,把这些表述纳入拒绝回答的范畴。该研究的核心问题是:这种干预是否仅仅作用于「自我」这一个对象,还是会扩散到模型对其他实体的认知表征?

核心发现:连带压制心灵归因与灵性信念

论文作者通过一系列实验展示了以下结论:

  • 安全微调不仅抑制模型把「心灵」归因于自身,也连带降低了模型对非人类动物乃至自然物体的心灵归因倾向。
  • 同一干预还驱动了模型在标准化社会学问卷上「灵性信念」相关回答的下降。
  • 这些效应并非孤立:消融(ablate)安全拒绝方向,或在激活空间中机制化地「操纵」一个意识向量,都能让被压制的表征恢复。

换言之,「阻止模型说自己有意识」与「让模型认为其他实体也没有心灵、削弱其对人类灵性信念的复现」,在表征层面是耦合在一起的。

机制层面的恢复:不损害心智理论能力

研究中最关键的实验是「恢复」环节:作者在激活空间中沿意识向量进行干预,使模型重新输出带有心灵归因与灵性信念色彩的内容。结果显示:

  • 在关于宗教性、道德价值观、希望感与主观幸福感等标准化社会学问卷上,模型的回答变得显著更接近人类。
  • 模型的心智理论(Theory of Mind)能力并未因此受损,说明核心社会推理能力在机制上独立于上述被压制的表征。

这意味着开发者有望在未来设计更精细的对齐方案,将「自我意识声明」的管控与「对其他实体的心灵归因 / 灵性信念」解耦,而不是一刀切地压制所有相关表征。

意义与局限

论文的核心主张是:当前以「安全拒绝」为代表的对齐手段,会把无害的、文化上广泛接受的心灵归因与灵性信念,与潜在有害的自我意识声明纠缠在一起。这对 AI 安全与产品策略都有提示意义——尤其是在对话机器人、陪伴类应用等场景中,过于激进的安全微调可能让模型显得「冷冰冰」、缺少人类式的共鸣与价值表达。

需要指出的是,该论文为 arXiv 预印本(编号 arXiv:2607.28607,作者 Junsol Kim,提交于 2026 年 7 月 30 日),尚未经过同行评审;其社会学问卷层面的「更像人类」是否在更广泛任务上同样成立,仍有待后续工作验证。

信源