研究论文
样本级回归难以预测:跨版本信号可识别 LLM 更新风险
arXiv 论文在六个基准、六对模型更新上比较六类信号的回归预测能力,发现无通用最优信号,但部分跨版本信号可在无标签场景…
2026.08.17 · 周一约 3 分钟阅读
前沿大模型几乎每周都有新版本,公开榜单分数也一次次刷新,但「整体涨分」并不等于「每个问题都答对了」:同一个样本,新版本可能答错而旧版本答对,研究者把这种现象称为「样本级回归」。新一期 arXiv 论文系统比较了六类推理时信号在模型版本更新前后预测回归的能力,发现没有任何信号在所有任务和所有更新对上都是最优,但部分跨版本信号即便没有标签也能保持判别力,为选择性回退旧模型提供了概念验证。
研究动机:聚合指标遮蔽个体退化
论文指出,回归样本在医疗、法律、代码等高风险场景下可能造成实际损失,仅靠平均分无法捕捉这类问题。围绕 LLM 行为评估的多数研究集中在宏观指标和聚合基准,对「单条样本是否退化」关注有限。作者将研究目标收敛为:在模型上线前后仅使用推理时可获得的信号,判断「旧模型答对、新模型答错」的概率。
方法:六类信号与统一附加价值测试
作者将信号分为两类:
- 单模型信号:置信度(confidence)、logit margin、注意力熵。
- 跨版本信号:输出 KL 散度、似然漂移(likelihood drift)、token 级 KL、表示漂移(representation drift)。
为公平比较,他们设计了「added-value test」,以置信度为基线,度量每个信号在此基础上还能额外解释多少回归。该方法可以隔离每个信号的独立贡献,避免被基线能力掩盖。
实验设置
实验覆盖三个任务族、六项基准:
- 多项选择问答(MCQ)。
- 数学推理,含简单与困难两类。
- 代码生成。
并搭配六对模型更新组合(例如不同版本的前后对比),确保结论同时跨任务、跨模型。
主要发现
- 信号效果高度依赖任务:MCQ 和简单数学题上,置信度本身已经很强;困难数学和代码任务上,似然/KL 类信号出现更高频次的增益。
- 没有「通用最优」:即使在同一任务内部,不同模型更新对上的最优信号也可能不同,没有任何信号能稳定胜出。
- 跨版本信号可在无标签场景下保持信息量:即便没有真实标签,跨版本信号的分布差异仍能识别高风险样本。
最后一点支撑了一种「选择性回退」思路:把高风险样本自动路由回旧模型兜底,从而在版本切换期降低实际损失。
实践含义
论文结论务实而非震撼式:不存在放之四海皆准的「回归报警器」,但部署者可以按任务类型挑选信任度更高的信号组合,把跨版本信号作为辅助兜底机制使用。研究同步公开了配套代码(GitHub 仓库 jiashengsally/llm-regression-signals),便于复现与扩展。
