桃子桃子快讯
返回首页
开源

北大开源 DataFlex-RL:统一接入强化学习数据策略

北大 DCAI 团队开源 DataFlex-RL,作为 verl 插件统一接入选择、重加权和领域混合三类数据策略,含 5…

2026.09.24 · 周四6 分钟阅读

强化学习在大模型后训练中的角色日益重要,但「哪些数据交给模型」始终是困扰研究者的实操难题。围绕推理模型与 RLVR 的发展,北京大学 DCAI 团队联合 UCAS、上海算法创新研究院、中关村学院发布并开源了 DataFlex-RL,一个面向强化学习训练流程的可配置数据策略框架。该项目以 verl 插件形式接入训练流程,将数据选择、样本重加权和领域配比做成可配置组件,论文发布后登上 HuggingFace 当日论文榜第二名。

框架定位:在同一套流程里比较不同数据策略

不同数据策略往往各有实现,换一个筛选规则就要改训练器;比较效果时,模型、奖励函数和训练预算又未必一致,很难判断提升究竟来自数据策略还是其他设置。DataFlex-RL 的目标是让研究者少花时间修改训练器,把精力放在验证数据策略本身。

框架复用 verl 的训练流程,将三类动作抽象为可配置组件:

  • 选择哪些 rollout 参与当前更新;
  • 给样本或 token 分配多大的学习权重;
  • 决定下一批数据从哪些领域采样。

这些策略直接读取奖励、优势、token 概率和 prompt 分组等已有信号,rollout、验证和策略更新代码基本保持不变。

三类动态策略:选择、重加权、领域混合

数据选择

在基于组内奖励差异的 GRPO 中,一组回答全部正确或全部错误通常无法形成有区分度的 advantage。DataFlex-RL 支持按组内解出率、advantage 排名、奖励方差和回答效率进行筛选。例如 difffilter 只保留解出率严格处于 0.2 与 0.8 之间的组,将训练集中在中等难度样本;topk 按排名截取 advantage 幅值靠前的回答。

动态重加权

当研究者希望保留当前批次全部回答、但让部分样本承担更大更新权重时,重加权机制适用。框架同时支持回答级和 token 级权重:softmax 与 per 基于 advantage 幅值调整回答贡献,diffband 对落在指定分位区间内的样本加权,ar 利用已有 token 概率对低概率 token 施加较低权重。所有权重均值归一到 1,以控制整体损失尺度的变化。

动态领域混合

数学、逻辑和科学任务的学习进度不同,固定比例未必适合每个阶段。DataFlex-RL 通过滑动窗口累计各领域反馈,由 mixer 更新后续批次的目标配比。实验中的 reward_gap、dump_ucb、tscl 分别基于领域奖励差距、探索反馈和训练变化速度调整采样比例。

技术架构:插件化接入与打分执行解耦

三类策略作用位置不同,但都需要读取反馈并转化为操作。DataFlex-RL 通过 verl 插件接入训练,注册自己的 trainer,在原有 advantage 计算完成后读取信号、运行策略,再将结果写入 verl 已有的 rollout_is_weights 字段。选择策略转成 0/1 权重,加权策略返回连续权重,两者由现有策略损失接口处理;领域混合使用单独的 trainer 与自定义 replay buffer。

打分与执行被刻意分开:Scorer 根据信号计算分数,Actuator 将分数转换为保留索引、连续权重或领域比例。同一份 advantage 幅值分数既可交给 topk 做筛选,也可交给 softmax 生成损失权重。组件按名称注册、通过配置组合,新增筛选方法时通常只需实现执行规则,需要新的判断依据时再扩展 scorer。

实验结果:591 次运行验证框架有效性

论文共进行 591 次实验,覆盖 Qwen2.5-7B-base 与 Llama-3.1-8B-base 等模型,以及数学、逻辑和科学任务。核心实验在 Qwen2.5-7B-base 上完成 156 次运行(13 个配置 × 12 个配对种子):未训练模型平均分 42.01,标准 GRPO 基线(均匀采样)训练后提升到 49.77,平均提升 7.76 个百分点;在 Llama-3.1-8B-base 上,模型从 10.87 提升到 21.12,平均提升 10.25 个百分点。这一基线为后续数据策略实验提供了参照。

在选择与重加权实验中,覆盖 difffilter、maxvar、gfpo、topk、ar、per、softmax、diffband 八种策略;在领域混合实验中,三种动态方法相对固定等比例混合的平均提升分别为 0.45、0.61 和 0.16 个百分点,展示了根据反馈调整领域配比的实际效果。Table 8 还从评测侧补充了完整汇总方式的比较。

与既有工作的关系

北大 DCAI 团队此前已开源 DataFlex,支持与 LLaMA-Factory 无缝集成,覆盖 Select、Mix、Reweight 和 Reorder 等数据操作。DataFlex-RL 将这套「数据灵活处理」思路延伸到 RLVR/GRPO 训练过程,根据训练反馈动态调度 rollout 与领域数据,与 DataFlex 形成互补,共同覆盖从数据准备到强化学习更新的更多环节。

GitHub 开源仓库:https://github.com/haolpku/DataFlex-RL 论文地址:https://huggingface.co/papers/2609.06107

信源