强化学习之父 Sutton 最新判断:大模型陷入局部最优,AI 必须学会持续学习
Rich Sutton 认为大模型因缺乏持续学习能力已陷入局部最优,其新创办的 Oak Lab 致力于攻克灾难性遗忘等底…
强化学习领域的先驱 Rich Sutton 最近在接受红杉资本访谈时,对当前主流的大模型路线提出了尖锐质疑。他认为,大语言模型虽然是一次惊人的科学突破,却可能让整个行业陷入「局部最优」:继续堆 GPU、做 Scaling,性能还能上涨,头部实验室因此越来越难转向短期表现可能更差的新路线。为此,Sutton 与学生 Khurram Javed 共同创办了 Oak Lab,目标是从底层重新构建一种能够从自身经验中持续学习的 AI Agent。
LLM 是《苦涩的教训》的成功,也可能成为反面案例
Sutton 在多年前写下《苦涩的教训》,核心观点是:能够随计算规模扩展的通用方法,最终会战胜依赖人工知识的方案。AlphaGo、深度学习、大语言模型都验证了这一判断。但他认为,LLM 同时也可能成为该论点的反面案例——今天的大模型虽然摆脱了大量人工规则,却被另一种「人类知识」限制住,那就是互联网。Sutton 指出,真实世界包含的信息量远远超过人类至今存储在互联网上的一切,仅靠训练前堆数据,总有一天会撞墙。
训练—冻结—上线范式的根本缺陷
更关键的问题在于,今天的大模型学习被人为切成了两阶段:训练时疯狂学习,上线后权重基本冻结。模型可以通过 Context 临时获取新信息、通过 Memory 记住用户偏好,但这与真正的学习相去甚远。Sutton 认为,真正的学习意味着经历一件事后系统本身发生变化:一个司机开了十年车,会形成大量不需刻意思考的直觉;而今天的大模型更像一个毕业时就被冻结的大脑,工作多少年都主要靠翻「毕业笔记」。这也是他对当前 LLM 最核心的质疑——为什么模型形成新概念、修改内部结构的能力只能发生在训练阶段?
合成数据绕不开人类瓶颈
面对互联网数据有限的问题,行业普遍寄希望于合成数据。但 Sutton 直言这是一个「大错误」,背后依然藏着人类瓶颈:谁决定什么数据值得生成、谁判断什么问题重要、谁定义奖励,最后绕一圈还是人。他提出的「大世界假说」(Big World Hypothesis)认为,智能体面对的世界永远比自身复杂,不可能提前学完,唯一可行的方法就是边走边学。
Oak Lab 要啃的硬骨头:灾难性遗忘
让模型每天更新权重之所以难以实现,根本原因是灾难性遗忘(Catastrophic Forgetting):修改一个权重可能同时影响大量已学到的能力。Oak 想解决的,正是一个非常底层的算法问题——让模型可以用连续进入的单条经验更新自己,同时不破坏过去的知识。Sutton 提出的方向之一是 Step-size Optimization:不同知识的「可塑性」不应相同,已被验证无数遍的知识应非常稳定,刚学到的则更易修改。另一个方向是 Continual Backprop:让训练多年的神经网络依然保持可塑性,更接近年轻大脑的状态。Oak 认为,未来训练基础模型时,应同时学习两件事——知识本身,以及「以后应该怎么学习知识」,也就是 Meta-learning。
真正的目标:能持续进化的心智
在 Sutton 的设想中,未来的 AI 不是单一全知模型统治所有任务,而是许多拥有同一套基本设计、却因经历不同而各自成长的「心智」。它们在不同环境中学习不同知识,彼此无法完全替代。智能不是把所有答案预先装进参数里,而是遇到新问题后仍能继续长出新的理解——这正是 Oak Lab 想要下注的方向。
