字节AI战略转向:拒绝蒸馏、押注数据、加速商业化
字节跳动明确拒绝模型蒸馏、组建千人级数据部门、推进5万亿参数模型训练,豆包同步开启会员与佣金商业化,AI战略从「追赶」转…
一向低调的字节跳动创始人张一鸣在 7 月底罕见现身 Seed 全员会,明确表态「拒绝将蒸馏作为提升 AI 模型能力的捷径」,并接受模型能力暂时落后于国内主要竞争对手的现实。随后在 8 月 5 日的字节全员会上,CEO 梁汝波进一步定调:字节大语言模型将坚定自研、做好基本功、接受短期落后、坚持优化长期。这一系列表态,标志着字节 AI 战略从「追赶」转向「自建生态」的全面调整。
拒绝蒸馏:从口号到制度
模型蒸馏指利用更强大的教师模型生成的数据训练学生模型。在国内 AI 圈,这一做法相当普遍。2025 年初 DeepSeek 发布 R1 时,同步开源了六个基于 R1 蒸馏的小尺寸模型;今年初 Anthropic 甚至指控 DeepSeek、Kimi 和 MiniMax 对其 Claude 发起「工业级蒸馏攻击」。
字节对蒸馏的警惕由来已久。早在 2023 年,模型团队就明确禁止将 GPT 生成的数据加入训练集。DeepSeek R1 出现后,Seed 内部曾讨论是否引入美国头部模型的输出进行蒸馏,但被管理层否决。直到 Kimi K3 出现后,倾向蒸馏的声音再度高涨,张一鸣才亲自出面定调。
据报道,全员会后 Seed 出台了新政策,明确禁止蒸馏 K3 等开放权重模型,并追溯排查疑似蒸馏行为。这意味着「拒绝蒸馏」已从原则口号转化为可执行的内部制度。
数据飞轮:字节最擅长的牌
拒绝蒸馏之后,字节把重心放在了数据上。近日,字节成立了新的一级部门「AI 数据与安全」,整合了超千人的数据团队,与 Seed、Flow、抖音等部门平行。该部门前身为 TikTok 创始团队成员傅越搭建的 Global Data 团队,将为字节所有大模型提供跨模态数据服务。
字节之所以押注数据,源于行业正在经历的结构性转变:大模型能力快速同质化,算法架构带来的提升趋缓,数据成为决定模型能力上限的关键变量。EpochAI 测算显示,语言模型训练将在未来五年耗尽人类公开文本数据,高质量语言数据的枯竭甚至可能提前至 2026 年。
相比之下,字节过去十年积累的数据飞轮是其独特优势:全球用户每天在抖音、今日头条等平台产生海量行为数据,涵盖图文、视频、直播与互动场景,这些真实且带上下文的数据,是训练原生多模态模型的稀缺资源。梁汝波坦承,豆包在 C 端应用上保持了竞争力,视频生成模型 Seedance 保持 SOTA,但大语言模型被海外领先模型拉大了差距。
商业化加速:豆包打通交易链路
在 C 端,豆包已建立起显著的规模优势。QuestMobile 2026 年 6 月数据显示,豆包月活达 3.82 亿、同比增速 172.1%,位居 AI 原生 APP 断层第一。在此基础上,豆包开始尝试收费:
- 推出 68 元、200 元、500 元三档专业版包月会员
- 飞书产品团队全盘并入豆包,打通生活与办公场景
- 自 8 月 10 日起,对经豆包跳转至抖音来客的成交订单抽取佣金,酒店订单综合费率约 12%,部分生活服务类订单约 18%
此外,据《晚点 LatePost》了解,字节正在讨论训练参数规模超 5 万亿的模型,若落地将成为目前国内已知参数规模最大的模型。Seedance 2.0 视频生成模型年化收入(ARR)已达 20 亿美元(约 143 亿元人民币)。
字节的 AI 商业化正形成三层闭环:豆包在前端蓄水圈住用户;B 端深入本地生活、办公等场景收费;Seed 与火山引擎在底层提供模型与算力。相较于通过蒸馏快速拿到好成绩,字节更愿意用时间打磨场景、积累数据,像孵化 APP 一样将大模型做成一个能长出商业模式的实体。
当然,AI 时代的变化总是快于预期,字节这只「慢龟」最终能否更快跑到终点,仍取决于竞争对手的节奏。
