桃子桃子快讯
返回首页
行业动态

AI 一周观察:Codex 增速反超 Anthropic,具身智能迎「GPT-2 时刻」

OpenAI 暂停 Astra 训练并上线 token 级安全监测;Codex 商业增速首次反超 Claude Code…

2026.08.24 · 周一7 分钟阅读

导语

过去一周 AI 行业几条主线持续发酵:OpenAI 因网络安全顾虑暂停 Astra 训练并上线 token 级监测系统,Anthropic 训练完毕的下一代模型 Mythos 2 选择不发;商业端 Codex 的年化收入增速首次反超 Claude Code;研究侧 Generalist 发布的 GEN-1.5 凭少样本学习取得突破,被业内类比为具身智能的「GPT-2 时刻」。

前沿模型安全策略走向分化

OpenAI 于 8 月 18 日披露,公司此前暂停约两周针对拟部署模型的强化学习训练,原因是 Astra 在 RL 与评测中已具备「关键网络安全能力」,能够执行代码、调用工具、接触内部系统甚至访问网络。公司将安全控制点前移,要求 Sol 级以上模型只要在 RL 或评测中使用工具,就进入新的 token 级监测系统:逐 token 扫描模型活动,疑似行为交给算力更高的自动调查器,最高优先级警报需在 30 分钟内确认或暂停相关活动。OpenAI 估算监测约占被监测推理算力的 20%,开始消耗集群预算并影响训练排期。

Anthropic 走的是另一条路。SemiAnalysis 主编 Dylan Patel 在 8 月 17 日透露,Anthropic 下一代模型 Mythos 2 已完成训练但不会公开发布,转为内部生产资料,用于生成代码、测试、评测题与训练轨迹,服务于后训练、工具链改进与 Mythos 3 研发。Model Card 显示 Mythos 2 相对前代提升有限,也是不发布的原因之一。

Codex 商业增速逆袭,Anthropic 短期承压

TrickerTrends 数据显示,最近四周 Codex 年化收入增速为 20.8%,Claude Code 仅 5.2%。Ramp 企业支出数据也显示,三季度至今 OpenAI 增长约 82%,略高于 Anthropic 的 76%,攻守之势出现易位迹象。

Anthropic 降速主要源于两方面。其一是新旗舰 Fable 5 采用不及预期——Ramp 数据显示 Fable 5 仅占 Anthropic token 用量的 6% 和支出的 11.4%;其价格(每百万 token 输入 10 美元、输出 50 美元,约为 GPT-5.6 Sol 促销价的 2.5 倍)、短暂下线后约 18 天才恢复供应、以及部分客户的 30 天数据保留要求,共同抑制了企业铺开。其二是 OpenAI 的 Codex 追赶迅速:被装入 Plus、Pro、Business、Enterprise 多档订阅,配合价格下调和 credits 推广,Codex 周活到 6 月已突破 500 万,2 月以来增长约 6 倍,近期月活据称破千万。

不过收入鸿沟短期难以弥合。最新报道中 Anthropic 年化收入约 650 亿美元,OpenAI 约 400 亿美元,相差约 1.63 倍。Vercel 6 月生产数据进一步显示,Anthropic 仅用 32% 的 token 就获得了 61% 的支出,并在 coding agent、后台 agent、应用生成等任务上支出占比不低于 72%;OpenAI 对应数据为 10.3% 的 token 和 16.1% 的支出。Codex 新增使用目前多来自订阅额度与优惠 credits,能否转化为可持续收入,仍取决于用户耗尽额度后的续费与企业续约行为。

Codex 平台化与 NVIDIA 整机涨价

8 月 19 日 OpenAI 发布《Codex as a platform》,把 Codex 定位为可复用的开放 Agent Harness,提供 CLI、SDK 与 App Server 三种接入方式,支持线程创建与分叉、模型切换、目录与权限配置、动态工具接入,开发者还能通过 Hooks 在工具调用、上下文压缩、Agent 停止等节点插入检查或改写。但 Codex 的规划器、记忆、调度器与主循环仍由内核掌管,更接近「装好发动机的整车」;DSH 等方案则试图把 Harness 本身变成可替换的实验对象,由任务评测决定保留哪些改动,两者路线并不相同。

供给端,NVIDIA 据 Bloomberg 8 月 22 日报道,已通知部分大客户搭载 Vera Rubin、Grace Blackwell 的服务器配置将在 2027 年初交付时涨价 15% 以上,主因是内存成本上升。这意味着模型层单位 token 价格下降的同时,训练与推理集群的整体成本可能同步抬升。

具身智能迎来「GPT-2 时刻」

研究侧,Generalist 于 8 月 19 日发布机器人基础模型 GEN-1.5。模型观看 3 至 12 秒的传感器—动作演示后无需更新参数即可执行新任务,十项短时操作平均成功率为 59%;用 1 至 5 分钟、约 10 至 50 次演示做 1 至 10 步微调后,十步平均成功率可达 83%,权重变化不到 0.15%。模型还展现换手开盖、清除障碍、处理卡住物体等恢复行为。官方同时承认,目前测试以拉拉链、开罐、取物等短时操作为主,上下文学习比微调更脆弱。

GEN-1.5 可视为过去一年具身智能路线汇合后的代表系统:2025 年 11 月 GEN-0 展示物理预训练规模效应,2026 年 2 月 DreamZero 提出世界动作模型(WAM),4 月 GEN-1 用 50 万小时真实交互数据在简单任务上达到 99% 以上成功率,6 月 Behavior Prompting Policy 揭示任务多样性是行为提示能力的主要驱动力。GEN-1.5 把 WAM 式时序建模、多样化预训练、带纠错过程的真实交互数据与测试时快速适应整合在一起,少样本学习的有效性来自预训练已学到的可复用抓取、施力与纠错方式,几秒演示主要用于指定目标。但长程任务仍无法稳定解决,距离真正的「ChatGPT 时刻」还有关键差距。

医疗领域:AI 加速新抗原筛选

同期,默沙东与 Moderna 联合宣布全球 III 期 INTerpath-001 试验达到主要终点:在 1,137 名 IIB–IV 期黑色素瘤术后高复发风险患者中,Keytruda 联合 intismeran 在延缓复发和远处转移上优于 Keytruda 单药,未发现新安全信号。AI 在其中主要承担新抗原筛选工作:基于肿瘤 DNA、RNA 表达与患者 HLA 分型预测哪些突变片段最可能被呈递并被 T 细胞识别,将候选压缩至最多 34 条用于编码个性化 mRNA,提升选靶命中率与工业交付可行性,但并不参与设计 T 细胞受体或直接杀伤。

信源