桃子桃子快讯
返回首页
行业动态

AI 不是泡沫:研究者解读大模型能力为何不会停滞

NLP 资深研究者撰文,从技术角度论证 AI 性能不会遭遇普遍预测的平台期,认为预训练与深度强化学习的结合是当前进展的核…

2026.08.21 · 周五3 分钟阅读

围绕「AI 是否处于泡沫」的讨论,往往同时纠缠着金融预期与技术前景两层议题。一位长期从事自然语言处理研究、并在 2009 年后转向开源 NLP 库与创业的从业者日前撰文,从技术层面提出反驳:AI 能力的提升并不会像许多人预期的那样很快撞上平台期。

「平台期」预测为何屡屡落空

作者指出,过去几年里关于 AI 将陷入停滞的主流论调基本一致:业界靠更多算力、更大模型、更长训练时间堆出了看似线性的进步,但底层方法存在收益递减,一旦指数级的资本投入放缓,进步就会停。这种「暴力缩放论」在他看来既缺乏对技术演进的细致观察,也与过去几年的实际进展不符。作者承认自己曾在 GPT-1、GPT-2 时代也预期过平台期,但回头看,这种预期忽视了预训练范式与深度强化学习两条研究线的合流。

预训练 + 深度强化学习:被忽视的关键合流

文章的核心技术论点是:当前大模型能力的来源,可以理解为「大规模预训练的生成式 AI(GPT 路线)」与「深度强化学习(AlphaZero 路线)」的结合。作者把推理过程类比为下棋:模型每生成一段文本相当于走一步棋,最终答对题目就是「赢」。这一思路若站得住脚,意味着只要继续在「让模型学会自己规划中间步骤」上加码——也就是当下业内所说的 chain-of-thought、reasoning、agent 等方向——能力提升仍有结构性空间,而非单纯依赖参数膨胀。

从 GPT-1 到 GPT-5:范式已经换了三轮

作者用同一类比题目(「柏林、伦敦、孟买三市人口之和是否大于澳大利亚?」)勾画三代模型的行为差异:

  • GPT-1:只会模仿网络文本的常见答法,无法拆解问题;
  • GPT-3:行为更复杂,大致能从见过的「分步回答集合类数字问题」的范例中提取出一个解题计划;
  • GPT-5、Claude Opus 等当代模型:被强化训练去「自己生成中间问题」,把问题拆成检索单值、再求和、最后比较几步。这与 AlphaZero 通过自我对弈学会下棋的过程在结构上同构。

作者因此认为,把 GPT-1/2 描述为「花哨的自动补全」虽然粗糙但尚可接受;对 GPT-3 来说这一说法已方向性错误;对当前模型而言,沿用这种认知会带来具体生活层面的误判。

作者立场与适用边界

作者在文中坦承其研究与大模型主线的距离:2004 年发表第一篇 NLP 论文,2005–2009 年完成博士,学术生涯至 2014 年,之后转向开源 NLP 库与小型创业。他自评为「与 LLM 主线研究有两三层分隔」,并非核心突破的直接参与者。文章更多是个人技术判断与行业观察的结合,而非新研究结果或官方披露。读者在参考其结论时,需留意这是一名「在场但并非核心圈」的从业者的观点,而非来自一线厂商或权威机构的数据结论。

(本文为编辑对原文观点的整理与转述,不代表本报立场。)

信源