桃子桃子快讯
返回首页
研究论文

用 LLM 生成的评语预测标准化试题的通过率

研究者结合 DeBERTa 与 Qwen3 生成的试题评语,构建自动评估模型,用于预测大规模标准化测试中试题的接受与拒绝…

2026.08.10 · 周一2 分钟阅读

一项发表于 arXiv 的研究提出「自动试题评估(Automated Item Evaluation, AIE)」框架,借助大语言模型生成的评语,预测大规模标准化测试中试题是否会被接受或永久拒用,从而减少人工审查与现场试测的成本。该研究覆盖 52,759 道英语语言艺术(ELA)与数学试题,其中约 34% 因心理测量属性不佳、内容问题、偏见与敏感性等因素被永久拒用。

方法:两条分类路径与一个融合模型

研究团队训练了三个模型:

  • DeBERTaV3-large 原始文本分类器:直接在试题原始文本上微调。
  • DeBERTa 评语分类器:先用 Qwen3 为每道题生成评语,再将评语作为输入进行分类。
  • 融合模型:将原始文本表征与 Qwen3 评语表征合并,输出最终预测。

融合模型在整体性能上表现最强,准确率达 0.75、F1 为 0.64、AUC 为 0.80,敏感度 0.64、特异度 0.81。

关键发现:数学比 ELA 更容易预测

  • 数学试题的预测效果明显优于 ELA:数学 F1 = 0.73、AUC = 0.86;ELA 仅 F1 = 0.51、AUC = 0.72。
  • 将决策阈值从 0.5 降至 0.25 后,ELA 与数学的平均敏感度分别升至 0.88 和 0.91,但特异度相应下降至 0.31 与 0.56。作者指出,在自动出题场景下,生成新题的成本低于评估成本,因此更倾向高召回、低精度的策略。
  • 引入 Qwen3 生成的评语后,模型在大多数拒用原因上的表现都有所提升。
  • 模型对难度更高的试题倾向于给出更高的拒用概率。

局限:公平性与敏感性仍是难题

研究也指出明显的不足:融合模型在识别因偏见、敏感性、公平性或可访问性问题被标记的试题时表现欠佳,这一缺陷在 ELA 上尤为突出。作者因此强调,文本驱动的 AIE 在部分领域可行,可有效减轻人工审查负担,但涉及公平性的试题仍需人类专家把关,不能完全依赖自动化判断。

信源