桃子桃子快讯
返回首页
研究论文

研究称 LLM 评分存在锚定偏差:先验分数会系统性扭曲后续判断

一项大规模实证研究显示,当 LLM 作为评分者时,上下文中的先验分数会显著锚定其后续判断,影响数值打分与分类决策。

2026.08.28 · 周五3 分钟阅读

一项即将发表于第 35 届 ACM 信息与知识管理国际会议(CIKM '26)的研究系统考察了「LLM-as-a-Judge」范式的可靠性问题。作者在 8 个语言模型上累计完成了 192,000 次评估尝试(其中 185,271 次成功),结果发现:当提示中包含先验分数等元数据时,模型的评分会被显著锚定,即使这些分数仅作为上下文出现,也会系统性地把后续判断拉向自身。这一效应在「数值打分」与「分类决策」两类任务中均得到验证。

实验设计与三个提示条件

研究设置了三种提示条件以隔离「锚定偏差」的来源:

  • 无元数据(基线)
  • 修订框架(revision framing):仅告知文本经过修订,但不提供具体分数
  • 锚定元数据:同时给出「修订」「尝试次序」与「先验分数」三个字段

在 20 段固定文本上,8 个被测模型中有 7 个的总效应(anchored-metadata effect)其 95% 分层自助置信区间完全位于零以下,表明锚定元数据带来的偏差具有统计显著性,而非随机波动。

效应规模与 token 层面行为

研究以 Cohen's d 衡量先验锚定与基线评分分布之间的标准化差异,其绝对值最高达到 0.71,属于中等偏大的效应规模。对模型—任务探针的 token 级分析还呈现「类阈值」响应特征:

  • 一旦引入锚定元数据,输出分数的概率分布发生显著重排
  • 在已低于阈值的范围内继续改变锚定数值,带来的额外变化相对有限

这意味着偏差并非线性、可预测的「跟随先验分数」,而是在有无锚定信息之间存在突变。

对分类决策的影响

在带有真人标注的行业数据集上,研究进一步测试了锚定偏差是否同样影响离散分类判断。结果显示:

  • 锚定元数据阻断了 48% 的「纠错机会」——即模型本应修正的标注,被先验分数抑制
  • 同时把 10.18% 的原本正确判断翻转成了指定错误标签

这表明锚定效应不只扭曲数值打分,还会实质性破坏分类评测的有效性。

现有缓解手段效果有限

作者还测试了两种常见的缓解策略:

  • Chain-of-Thought(思维链提示)
  • 在提示中加入「请勿参考元数据」的警示语

两者均未能降低锚定元数据的总效应;不过在行业数据的成对准确率(paired accuracy)实验中,警示语相对基线带来了一定改善。作者据此指出:「可靠的 LLM 评估需要精细的上下文工程,而非默认模型是公正的。」任何缓解方案都应在目标模型与具体任务/领域上做独立验证,而非通用套用。

该研究以 arXiv 预印本形式发布(编号 2608.25869),正稿将收录于 CIKM '26 论文集。

信源