桃子桃子快讯
返回首页
行业动态

AI 巨头争夺人类的错题本:数据飞轮成新战场

AI 竞争正从模型参数转向真实工作流的反馈数据,OpenAI、Anthropic、腾讯、SpaceX 纷纷抢占 codi…

2026.07.20 · 周一4 分钟阅读

2025 年 7 月,AI 大战的关键战线陡然升温。OpenAI 创始人奥特曼于 10 日凌晨重摆阵形,发布新版 ChatGPT 桌面端,将原本独立的 Codex 并入其中,与「Chat」「Work」三个标签并列。这一调整几乎构成了 OpenAI 下一阶段的作战地图:Chat 守住原有聊天入口,Codex 切入程序员终端,Work 则瞄准表格、文档和办公流程。表面上是一次产品整合,背后是 AI 巨头争夺「真实工作流反馈数据」的全面升级。

编程与办公:被抢走的「错题本」

这场争夺中最难缠的对手是 Anthropic。其 Claude Code 最初只是编程助手,4 月 Claude Mythos 在 SWE-bench 上拿下 93.9%,迅速被程序员接纳并进入企业代码库。随后,Anthropic 把同一套打法推向办公场景,Claude Cowork 接管表格、文档和企业流程。靠 coding 和办公 Agent 撕开的商业化缺口,Anthropic 的 ARR 从年初的 140 亿美元暴涨至 470 亿美元,估值接近万亿美元反超 OpenAI,企业市场份额达 34.4% 同样实现反超。

Anthropic 挖到的并非单纯的「金矿」,而是一台会自己加速的机器——数据飞轮。链条并不复杂:更好产品 → 更多用户 → 更多纠偏数据 → 更强模型 → 更好产品。代码场景具备高纯度对错信号,办公场景任务链更长、信号更密,两者共同构成下一代模型最稀缺的过程数据。在公开互联网高质量语料走向枯竭、Scaling Laws 出现裂痕的背景下,真实工作流中的反馈数据成为决定胜负的关键资源。

Harness:飞轮背后被忽视的系统

飞轮真正难建的地方不在于产生原料,而在于把混乱、模糊、甚至互相矛盾的用户行为炼成模型能吸收的经验。这一步取决于一层看不见的系统:Harness。它负责拆解任务、调用工具、检查结果,并把一次失败整理成经验送进下一轮迭代。

前 OpenAI 安全副总裁翁荔在近期博文中判断,AI 的自我改进更可能先发生在 Harness 层,而非直接改写模型权重。成熟的 Harness 一边帮助现有模型把事做成,一边记录模型在哪里失败、用户如何修改,把这些经验送回产品和模型,两者咬合后数据飞轮才真正转动。这意味着,即便模型暂时落后,通过抢占工作流、磨炼 Harness、构建数据飞轮,也能开辟超车路径。

飞轮从另一边转动

大洋彼岸的腾讯率先抓住了这个窗口。春节后的「龙虾」热潮中,办公智能体 WorkBuddy 闯入公众视野,而它的底座编程助手 CodeBuddy 已打磨多时。WorkBuddy 先在腾讯内部 2000 多名非技术岗员工使用,3 月 PC 端月访问量达 885 万,跑到了中国同类产品日活第一。

在产品先拿到用户和任务后,反向推动模型进步成为可能。Hy3 训练时,WorkBuddy 暴露出的指令遵循、工具调用和长任务执行问题被纳入评测与训练目标,部分授权反馈进入后训练。Hy3 Preview 接入后,WorkBuddy 首响提速 54%,任务总时长缩短 47%;7 月 Hy3 正式版发布时,任务成功率从 72% 升至 90%,耗时再缩 34%,总调用量较上一代增长 68 倍,主动选择 Hy3 的用户占比达六成。

截断的数据管道

马斯克则选择了另一条路:直接砸下 600 亿美元收购代码编辑器 Cursor,接入大模型 Grok。数周后发布的 Grok 4.5 由 SpaceXAI 与 Cursor 联合训练,训练中使用了数万亿 Token 的 Cursor 数据,包含开发者怎样调用工具、修改结果以及 Agent 在真实环境里完成任务的全过程。在 SWE-bench Pro 上,Grok 4.5 拿到 64.7%,尚未追上 Claude Opus 4.8 的 69.2%,但已坐到了同一张牌桌上。

模型榜单还会不断易主,但当竞争进入普通人的桌面和日常工作流,后来者要追赶的就不再只是一次模型发布,而是对手在千万次真实任务中持续优化模型的循环。飞轮一旦转起来,每天都在滚动复利,这正是本轮 AI 竞争最残酷、也最容易被忽视的门槛。

信源