字节组建AI数据一级部门,由TikTok业务高管掌舵
字节成立AI数据与安全部,与Seed等一级部门平行;负责人来自TikTok业务线,反映数据生产已成公司级战略能力。
字节跳动近期成立 AI 数据与安全部门,与 Seed、Flow、抖音等一级部门平行,统一负责为旗下大模型提供跨模态数据服务。这是字节首次将分散在各业务线的数据团队,整合为独立的一级部门。
原 AI 数据体系负责人傅越(Yuyi)已在 8 月 11 日宣布即将离职,新部门由长期负责 TikTok 业务的王赢磊(Adam Wang)接手。王赢磊此前先后担任 TikTok 直播负责人和 2025 年新成立的「平台责任团队」负责人。这一人事安排,成为这次调整最受关注的部分。
数据从「后台支持」升级为「一级部门」
字节的数据体系在过去几年迅速膨胀。新部门整合了傅越 2023 年组建的 Global Data、集团数据中台 DMC,以及 Flow 旗下的 AI 数据平台 AIDP 等团队。这些原本分散在不同业务线的能力,被统一收拢进新部门。
据相关报道,仅 Seedance 的数据评测团队就已达到上千人规模,每名算法工程师背后通常配备十余名数据人员;世界模型与 Coding 模型的训练也在大量采购和生产数据,2026 年初相关数据预算已超过千万美元。新部门成立后,将横跨基座模型与具体业务,承担语言、视频、代码、世界模型等不同模态的数据生产与评估。
把数据交给「职业管理者」,而不是模型科学家
与 DeepSeek 让核心研究员亲自下场标注数据、阿里让 Qwen 模型研究者直接带队不同,字节选择了另一种分工:新部门负责人来自业务一线,而非模型研究背景。
文章认为这有合理性。当数据部门需要为多个模型团队调配预算、供应商和生产能力时,保持组织上的中立、避免偏向某一研究方向,反而更利于规模化运作。字节本身也是一家强调「组织能力」的公司,面对需要迅速扩张的方向,习惯通过专业分工、赛马机制和庞大组织把它做大。
但这一选择也留下悬念。当「生产什么数据」越来越成为研究本身的一部分时,把数据部门交给职业管理者,能否同时保持高度专业化和对模型前沿的敏感度,是字节尚未给出标准答案的组织难题。
行业正在围绕数据重新组织
字节的调整并非孤例。腾讯在今年 2 月重建预训练和强化学习基础设施,7 月将混元多模态部门与大语言模型部门合并为「基础模型部」,并交由前 OpenAI 科学家姚顺雨统一管理;其内部从 50 多个业务中收集真实反馈,作为后训练数据。阿里 Qwen 则一直由模型研究者林俊旸直接带队。
与此同时,一个十亿美元级的 AI 数据产业正在快速形成:
- Mercor:从 AI 招聘平台转型为 AI 数据供应商,2025 年 6 月年化总收入已超 20 亿美元,上半年 91% 收入来自 OpenAI、Anthropic、Google DeepMind 等基础模型公司。
- Handshake:原本是大学生招聘平台,2025 年开始组织博士、律师、医生生产训练数据,相关业务年化收入在一年内从 500 万至 1000 万美元升至约 10 亿美元。
- Scale AI:Meta 在 2024 年以约 143 亿美元获得其 49% 股份,目前该公司近一半新项目已涉及强化学习环境(RL environments)。
- Mechanize:据报道正与谷歌洽谈一笔超过 15 亿美元的交易,向其提供虚拟工作环境,用于训练 Agent。
数据从「训练开始前准备好的原材料」,变成了需要公司级持续生产的基础设施。这也是字节选择把数据部门抬到一级位置的底层逻辑。
