桃子桃子快讯
返回首页
研究论文

用 Rasch 测量理论审视 LLM 评分者:九款模型与人类评分者的系统性偏差

arXiv 新论文主张将 Rasch 测量理论纳入 LLM-as-rater 评测框架,发现 9 款大模型在严重度、题项…

2026.08.31 · 周一4 分钟阅读

随着大模型在内容审核、自动化标注、AI 反馈(RLHF)等场景中扮演「评分者」角色,如何评估 LLM 评分者本身的可靠性与偏差,正在成为评测领域的核心议题。arXiv 上一项新研究提出,将起源于心理测量学的 Rasch 测量理论(RMT)引入 LLM 评测框架,并以仇恨言论语料为案例,系统比较了 9 款主流大模型与人类评分者之间的差异。

研究背景:LLM 同时坐在评测的两侧

论文指出,当前的 LLM 评测存在三种典型范式:

  • 作为「被试」:在基准测试中被打分;
  • 作为「裁判」(LLM-as-judge):评估其他模型的输出质量;
  • 作为「评分者」(LLM-as-rater):对人类生成内容进行标注,例如安全分类、内容审核、偏好打分。

然而,现行的标准评测方法往往把这些角色混为一谈,忽视了三类评测在测量对象、量表结构和偏差来源上的本质差异,也难以揭示「究竟测的是什么」。论文主张,LLM 评测本质上是一个测量问题,因此应借助成熟的心理测量工具来分析。

方法论:把 Rasch 模型请进来

Rasch 测量理论(RMT)是一种经典的潜在特质测量框架,其核心思想是把有序评分分解到同一量尺上的多个独立维度(facet),并提供诊断工具来识别量表失校和评分者偏差。本研究使用的扩展形式——多面 Rasch 模型(many-facet Rasch model)——允许同时估计「评分者」、「被评对象」和「题项」三者各自的偏差贡献。

论文选取的案例语料是「Measuring Hate Speech」语料库,该语料本身就是在 RMT 框架下构建的,具备良好的测量学属性。研究团队在该语料上对来自不同家族、不同能力档次的 9 款 LLM 进行标注实验,并拟合了一系列多面 Rasch 模型进行比较。

关键发现:系统性的五维偏离

研究通过对比 LLM 与人类评分者的拟合结果,发现 LLM 在以下五个维度上系统性偏离人类基准:

  • 严重度(severity):LLM 整体打分倾向与人类不一致,有的更宽松、有的更严苛;
  • 题项校准(item-level calibration):不同 LLM 对同一题项的相对难度判断差异显著;
  • 问题顺序鲁棒性(question-order robustness):当题项呈现顺序改变时,LLM 打分稳定性弱于人类;
  • 目标身份敏感度(target-identity sensitivity):当被标注对象涉及不同身份群体时,LLM 表现出与人类不同的敏感模式;
  • 评分量表使用(rating scale use):LLM 对评分量表各等级的利用效率与人类不同,存在天花板或地板效应。

论文强调,这些偏差在传统的「准确率 / F1 / 一致性百分比」指标下几乎不可见,因为聚合指标会掩盖评分结构上的系统性差异。

启示与展望

论文最后提出三点主张:

  • RMT 应作为评估 LLM-as-examinee、-judge、-rater 三种范式的标准工具之一;
  • 在部署 LLM 担任评分角色的场景(如安全过滤、数据标注、奖励建模)前,应使用 RMT 类工具对其打分行为进行校准检验;
  • 多面 Rasch 模型不仅能揭示偏差,还能定位偏差来源——是评分者问题、题项问题还是量表使用问题——为改进提示词工程与模型微调提供具体抓手。

对于正在大规模使用 LLM-as-judge 或 LLM-as-rater 的研究团队和工业界而言,这项工作提示了一个长期被低估的风险:看似方便的自动化评分,可能在量表层面就与人类判断存在结构性背离。

信源