桃子桃子快讯
返回首页
研究论文

Ai2 研究:偏好训练可改善 LLM,也会悄悄恶化其他行为

Ai2 利用其开源 post-training 栈预测完整训练对模型回复的影响,发现让模型看到「人类偏好的回答」与「不偏…

2026.09.10 · 周四2 分钟阅读

Ai2(非营利研究机构 Allen Institute for AI)在 X 平台发布消息称:让一个大语言模型在训练中看到「人类偏好的回答」与「不偏好的回答」,确实能提升其在偏好维度上的表现,但同一过程会悄然改变模型对其他提示的回复行为。这并非单纯的「训练有效」或「训练有害」的故事,而是一项关于偏好训练副作用的可量化预测结果。

关键发现:用偏好数据训练会"按下葫芦浮起瓢"

Ai2 指出,常见的偏好对齐训练(例如基于人类反馈的强化学习或类似 DPO 的方法)通常以单一或少数维度上的胜出率作为优化目标。但模型在不同提示上的行为并不是孤立的——提升某一类问题的回答质量,可能会在用户没有显式衡量的维度上引入退化。

  • 偏好训练在目标指标上带来提升;
  • 同时,模型对未参与训练提示集的回复分布发生偏移;
  • 这些偏移往往在评测基准之外,难以被常规榜单捕捉到。

方法:开源 post-training 栈提前预测行为变化

Ai2 强调,本次工作的关键是利用其开源的后训练栈(open post-training stack)在完整训练跑出之前,对一次完整训练运行将如何改变模型在不同提示下的回复做出预测。换言之,研究者可以在投入大规模算力之前,先观察到训练可能带来的「副作用图谱」。

  • 预测基于开源的训练框架,便于复现;
  • 合作方 Goodfire AI 参与了相关分析工作;
  • Ai2 表示完整研究内容将以长帖与后续材料形式进一步披露。

意义:对齐研究需要更全面的"行为体检"

这一发现对当前主流的偏好对齐流程提出了两点提示。第一,仅以胜出率或单一基准衡量训练收益,可能高估模型的真实进步;第二,post-training 阶段的工具链正在从「跑得动」走向「可预测、可审计」,开源训练栈的价值因此进一步提升。对于正在搭建自有对齐流程的团队而言,Ai2 的工作提供了一个将"行为漂移"纳入训练决策的可行思路。

备注:原文为 Ai2 在 X 平台发布的预告帖,完整论文或技术报告尚未在本次摘录中提供,后续披露的具体 benchmark、数据集与训练配置可作为参考补充。

信源