研究论文
同意≠对齐:LLM 与人类伦理判断依据存系统性分歧
arXiv 研究指出,LLM 与人类道德标签高度一致,但推理所依据的道德原则却存在系统性分歧。
2026.08.15 · 周六约 2 分钟阅读
在 LLM 伦理评估中,「与人类判断一致」长期被视为对齐(alignment)的替代指标。然而,一篇发表于 arXiv 的论文《Agreement Is Not Alignment: Divergent Moral Grounds in Human and LLM Ethical Judgments》指出,最终标签的一致并不代表模型与人类在道德推理上真的站在同一基础之上。
研究问题
作者提出一个核心问题:两个系统即便给出相同的最终判断,也可能基于不同的原则、情境假设或对情境的解读。换言之,「同意」可以被伪装成「对齐」。要判断模型是否真正与人类价值观对齐,需要穿透标签,看其背后的理由。
方法与数据
研究团队构建了一个基于 ETHICS 数据集、经过精选的 500 题基准,涵盖五个道德判断领域,并同时收集了人类标注者与多款前沿及开源 LLM 的两组标注:
- 最终标签(final label)
- 支持该判断的理由(rationale)
评估对象跨越「前沿模型」与「开源模型」两大类家族,覆盖范围较广。
核心发现
- 在最终标签层面,主流模型与人类标注者多数票的一致率普遍较高。
- 深入到理由层面后,模型与人类在「道德依据」上出现系统性偏差。
- 具体而言,模型会在「伤害」「尊重」「守信」「公正」「应得」「免责相关性」等道德类别之间重新分配注意力,即便其最终标签与人类多数票一致。
这意味着,模型可能是「答对了题」,但「想错了理由」。
意义与启示
该研究对当前 LLM 评估实践提出警示:仅依赖标签层面的吻合度会给出「虚假的安心感」。要更可靠地衡量对齐,需要补充对模型判断理由、原则与道德优先级的分析。后续评估基准、模型审计与对齐研究都可能因此引入「理由一致性」作为新的考察维度。
论文编号为 arXiv:2608.12368v1,已在 arXiv cs.AI 板块公开。
