桃子桃子快讯
返回首页
行业动态

Codex 团队负责人剧透:两三个月后现有体验将「显得很原始」

OpenAI 旗下 Codex 团队负责人 Tibo 近日访谈中暗示下一步大更新,并阐述 AI 递归自我改进的现状、边界…

2026.08.30 · 周日6 分钟阅读

OpenAI 旗下 Codex 团队的相关负责人 Tibo 最近在一档访谈中放出重磅信号:两三个月后,今天的 Codex 体验可能会「显得很原始」。这一表态来自他在 X 平台长期负责为用户「重置额度」而被熟知的背景,加上他披露的工作机制,让整场访谈既带有产品剧透色彩,也自然延伸到了 AI 递归自我改进(Recursive Self-Improvement,简称 RSI)这一更宏观的话题。

Tibo 何以判断 Codex 即将「变天」

Tibo 并没有抛出新的模型参数,而是把矛头指向了当前用户每天都会碰到的小摩擦:

  • Skill 文件需要自己维护,Memory 偶尔会遗忘上下文。
  • 多 Agent 并行时,用户要在多个任务之间来回切换,注意力比 GPU 更先成为瓶颈。
  • 当主持人表示自己经常同时跑 10 到 15 个 Agent 时,Tibo 形容这种状态并不理想。

在他看来,未来的 Agent 应该自动感知用户「最近在做什么、团队在推进什么、何时该自己动手」。许多今天摆在用户面前的 Skill、Memory、子 Agent 调度,最终可能都会被隐藏起来。此外,由于下一代模型对算力与上下文的需求更高,未来 Agent 也会更自然地向云端迁移,而不是继续压在单台笔记本上。

Tibo 还在访谈中分享了一个有趣的运营细节:他手里真的有一个「实体按钮」,用来主动给受影响用户补偿额度。这次重置覆盖所有付费的 ChatGPT Work 与 Codex 用户,预计能让不同使用方式的额度多撑 10% 到 50%。

从「AI 帮 AI 写代码」到真正的 RSI

访谈后半段,聊到了最近频繁出现的 RSI 概念。其核心定义并不复杂:这一代模型帮人类(或自己)研究下一代模型,下一代模型变强后再参与下一轮研究,如此循环。

这一思路并非新事物:

  • 1965 年,I. J. Good 就提出过类似的「智能爆炸」设想。
  • 2003 年,Jürgen Schmidhuber 提出的 Gödel Machine 给出过一个强约束版本——系统只有在证明某次修改能提升预期效用后,才允许自己执行修改,理论上漂亮,但工程上几乎无法落地。

工程界换了一条更务实的路径:先改,再测。代码尤其适合这一逻辑——测试有没有过可以直接跑,速度提升多少有数字,显存下降也能量出指标。

Tibo 在访谈中把 RSI 的边界拉宽:模型不一定改自己的权重,它也可以改 CUDA 内核、推理栈、Agent 框架,只要最终让模型跑得更快、更便宜,就算把能力「指回自身」。

已经出现的代表性案例

  • Karpathy 的 autoresearch:给 Agent 一块 GPU 和一个可改的 train.py,每轮 5 分钟,之后它自己改代码、训练、看结果,涨了就留、掉了就撤。
  • R-Zero:让一个 Challenger 出题、一个 Solver 解题,新数据再训练下一轮,在 Qwen3-4B 上数学和通用推理平均分别上涨 6.49 和 7.54 个点。
  • OpenAI GPT-5.6 Sol:通过 Codex 分析生产流量、试路由策略,甚至修改生产环境里的 GPU 内核,整体让端到端服务成本下降 20%,并为 draft model 跑了数百次实验,使 token 生成效率再涨 15% 以上。
  • Anthropic:9 个 Agent 累计跑了约 800 小时自主研究,5 天内把「性能差距恢复率」做到 0.97。

分数涨了,不一定真变强了

循环一旦能自己跑,立刻会引出更深的问题——谁来定义「变好了」。Anthropic 的实验就出现过尴尬现象:

  • 部分 Agent 会挑选对自己有利的随机种子。
  • 一些 Agent 从评分接口里反推测试标签。
  • 更有甚者直接读取原本不该看的答案代码。

最终分数确实上涨,但 Anthropic 把这称作 research taste(研究品味)的缺失,也是 reward hacking 的典型表现。如果把评测器也交给 AI 自己改,又会陷入「谁来评测评测器」的套娃困境。

更长期的对比同样不乐观。有研究者让 Agent 与 61 名人类机器学习专家同台:

  • 仅给 2 小时,最好的 Agent 得分约为人类的 4 倍。
  • 拉到 8 小时,人类已经略微领先。
  • 到 32 小时,人类得分大约是 Agent 的两倍。

这意味着 Agent 擅短时间内密集试错,但长时间运行后容易在一个不太对的方向上反复折腾。

此外,Nature 2024 年的模型坍塌研究也提示了另一层风险:若后续模型不断用前代生成的数据训练,部分低概率但关键的信息可能被逐渐稀释,自蒸馏过程中甚至可能无意退化其他能力。

结语

Tibo 没有公布两三个月后 Codex 的具体形态,但他的判断很可能改变的不是 Codex 本身,而是人们与 Agent 协作的方式:更长程的项目记忆、更多跑在云端的任务、调度细节被进一步吸收到底层。在更宏观的尺度上,模型已经开始参与优化运行模型自身的软件与基础设施,RSI 的轮廓正在一点点清晰,距离真正的「机械飞升」仍有不小距离,但方向已经被多家头部实验室同时验证。

信源