桃子桃子快讯
返回首页
研究论文

arXiv 研究:LLM 预训练中领域数据重复次数的 scaling 规律

论文研究大模型预训练时高质量领域数据的最佳重复次数,发现最佳重复次数随模型规模轻微增长,且可用小模型代理调参。

2026.08.30 · 周日2 分钟阅读

在大型语言模型的预训练中,训练 token 预算需要与模型参数规模保持合适的「token-per-parameter(TPP)」比例。然而,高质量领域数据的获取难度远高于通用网页数据,随着模型变大与训练预算增长,领域数据在训练混合中的占比往往被稀释。对稀缺领域数据进行「重复采样」是缓解稀释的常用做法,但过度重复又会带来过拟合风险。arXiv 论文《Scaling Domain Data Repetition in LLM Pretraining》(arXiv:2608.14071)系统研究了这一权衡。

核心问题与实验设置

论文聚焦于一个现实约束:在训练 token 预算与模型规模近似成比例增长的典型 scaling 场景下,针对某个固定领域,应重复多少次该领域数据?作者通过控制 TPP 不变的对照实验,在不同模型规模上考察领域数据的最优重复次数,并比较各领域最终验证损失与重复次数之间的关系。

三条主要发现

  • 固定 TPP 下,最优重复次数随模型规模轻微增长。 直观上常认为更大模型应该「用更多新数据」,但实验显示在保持 TPP 不变时,更大的模型对同一份领域数据的最优重复次数反而略有上升,说明重复并非简单的「过拟合陷阱」。
  • 领域最终验证损失越低,最优重复次数越高。 跨领域比较表明,最优重复次数与领域最终验证损失呈显著负相关——模型在某个领域上 loss 越低,就越能「消化」更多重复带来的训练信号。
  • 领域独有数据量与最优重复次数关系很弱。 与「数据越少越要重复」的直觉不同,领域内独有 token 的绝对数量对最优重复次数几乎没有解释力,重复策略更应参考 loss 水平而非数据稀缺度。

实践意义

基于上述规律,论文指出一个对工业界友好的结论:在固定 TPP 的前提下,可以用较小的代理模型来调优重复次数,并将结果外推到更大的模型。这意味着团队不必在最大规模模型上反复试错,就能为领域数据挑出近似最优的重复倍数,从而节省训练算力与调参周期。

论文提交于 2026 年 8 月,归属 cs.AI 分类,DOI 由 DataCite 经 arXiv 颁发。对于需要在垂直领域(如代码、数学、对话)数据上做长训练、但又面临数据稀缺的团队,这套经验法则值得作为训练配方设计的参考依据。

信源