桃子桃子快讯
返回首页
行业动态

真实工作流数据:AI 训练的新矿藏

36氪深度行业观察:real-world data 正成为前沿大模型训练新方向,剖析 Human data 公司与 RL…

2026.07.23 · 周四6 分钟阅读

AI 行业正悄然迎来新一轮数据范式转变。36氪最新发布的深度行业观察指出,企业真实工作流中产生的数据——即 real-world data——正成为前沿大模型训练的新矿藏。这场趋势催生了 Human data company 与 RLaaS(RL-as-a-service)两类新公司,并正在重塑从数据采集、标注到强化学习环境的整条供应链。

数据市场是一门冲浪生意

AI 数据市场的赢家随着训练范式的变化不断更迭。Scale AI 抓住了自动驾驶与早期 LLM 的数据标注机会;Mercor、Surge AI、Handshake 赶上了专家数据浪潮;当训练进一步转向真实工作流时,Protege、Sunset、SF Data 等新公司开始涌现。与此同时,老玩家也在紧跟 frontier labs(前沿实验室)的需求调整方向,Mercor 和 Handshake 最近都开始讲企业数据的故事,为下一轮浪潮提前卡位。

这一波浪潮的核心驱动力是「Long Horizon」(长链路任务)。模型处理任务的单位正从单次代码修改,上升到整个文件、codebase,最终是一整个项目。任务越长,人工搭建环境越难——真实项目中的历史状态、工具依赖、组织规则和意外分支,很难靠专家坐在沙盒里凭空编出。因此 frontier labs 开始大规模采购真实世界的数据。

真实数据的两条路径:Type 1 与 Type 2

根据数据来源,当前市场可被分为两类:

  • Type 1:真实工作数据——接近「工作过程录像」,例如 Session replay、屏幕操作、公司内部协作记录。GitHub 上的 commit message、issue 与 ticket resolution 串联起来,几乎完整保留了一个问题从出现到解决的全过程,包括意图、尝试、原因和最终是否被接受。
  • Type 2:人工构造数据——当前绝大多数 human data 公司在做的事情:找领域专家、设计任务、让其完成工作、收集结果、再加工成可训练格式。

Type 2 适合预训练或早期能力爬坡,但当模型开始处理更长链路、更高经济价值的任务时,Type 1 会越来越重要。现实中更可行的是 Type 1.5 的中间形态,包括长期绑定高质量专家、重新设计激励机制以防止人类 reward hacking、构建多层 QA 体系并把质检方法逐步工程化。文章判断,随着数据价值向 Type 1 迁移,Type 2 的窗口可能只剩两年。

hillclimbability 与市场痛点

设计训练任务时,真正重要的是「爬坡能力」。让前沿模型做不出来的任务并不难,难的是让任务恰好卡在模型能力边界上——既有挑战性,又可通过训练逐步提升。文章给出两个判断示例:

  • pass@1 = 0%,pass@32 = 30%:模型偶尔能摸到成功路径但尚不稳定,属于有训练价值的好任务。
  • pass@1 = 0%,pass@256 = 0%:任务可能远超当前能力或过于偏门,通常不适合作为训练基准。

当前数据市场存在四类问题:数据失真(Type 2 被包装成 Type 1)、Eval 失真(供应商刻意加难度制造提升空间假象)、QA 不可规模化(靠堆人力而非工程化解决)、需求传递失真(researcher 与供应商之间信息易出现磨损)。

供应商若想获得 frontier labs 的信任,通常需要证明三种能力:Data taste(把握数据质量)、Research taste(知道模型卡在哪里)、Scalability(规模化后仍保持同等质量)。可以通过招聘结构粗略判断公司 DNA——更偏 Type 2 的公司频繁招 SPL(Special Project Leads),本质上是卖人力;而真正想向 Type 1 靠拢的公司几乎只招 technical staff,目标是建工厂。

RL 环境进化与样本效率新思路

Agent 的环境与任务都在变得更复杂,主要体现在四个方向:空间变大(agent 穿梭于多个 environment)、工具变活(可能直接调用另一个 SOTA 模型)、组织变复杂(多个 sub-agent 协作,reward 需衡量成本与延迟)、任务边界上移(RL env 的训练目标从执行单步动作上移到规划和编排整套工作流)。

然而真实世界难以像代码仓库那样被复制成上万个并行 container 让模型反复训练。因此 AI 进入真实世界,必须提高 sample efficiency,从少量、不可重复、反馈模糊的经历中快速提取可迁移规律。文章介绍了两种思路:

  • OPSD(on-policy self-distillation):一种「经验压缩」机制。让已与用户协作一周、形成组织理解的「老员工模型」充当 teacher,指导基础模型。学生学习的不是历史细节,而是 teacher 最终形成的判断方式——哪些信息更重要、何时应追问、什么情况下可直接行动。这种方法的优势在于:即使项目最终成败需要数月才能揭晓,带完整 context 的 teacher 也可以在过程中每个决策点提供更好的行动示范,把稀疏反馈转化为相对密集的训练信号。
  • Dreaming:如果说 OPSD 是向内压缩经验,Dreaming 则是向外延展想象,让模型在训练中模拟未曾经历过的情景以提升泛化能力。
信源