桃子桃子快讯
返回首页
行业动态

奥特曼罕见点名:真正的「GPT之父」

奥特曼在最新访谈中罕见点名,称 Alec Radford 是 AI 史上最重要却鲜为人知的研究者,横跨 GPT-1、GP…

2026.08.17 · 周一6 分钟阅读

OpenAI 联合创始人兼 CEO 山姆·奥特曼(Sam Altman)在最新一期《Invest Like The Best》访谈中,给出了一个罕见的评价:他认为 Alec Radford 可能是 AI 历史上最重要、却最不为人知的研究者。奥特曼直言,Radford 的工作后来真正演变为 GPT 系列,且不断启发同事把研究推向后来被证明极为重要的方向。这一公开「点名」,把长期隐身于论文作者栏里的这位研究者推到了聚光灯下。

从 Kaggle 选手到 OpenAI 的最早成员

Alec Radford 的本科在波士顿的欧林学院度过,期间他与同学一道参加 Kaggle 数据竞赛,还在宿舍里创办了一家小型 AI 公司 Indico。2016 年,时年 23 岁的 Radford 受邀加入 OpenAI。他自己回忆,这份工作「有点像读研究生」——没有太多短期压力,也没有必须立即做成的产品。

在 OpenAI 早期,他先尝试用 20 亿条 Reddit 评论训练语言模型,结果并不理想。随后他把数据范围缩小到约 1 亿条亚马逊商品评论,让模型完成一项极其简单的任务:根据前文预测下一个字符。训练过程中,一个意外现象出现了:模型内部有一个神经元开始主动区分评论的正负情绪——它在没有显式监督的情况下,自行学会了情感分类能力。OpenAI 后来将这一发现写进论文,称之为「无监督情感神经元」。

GPT 路线的真正起点

2017 年,谷歌发表论文《Attention Is All You Need》,首次提出 Transformer 架构。OpenAI 联合创始人 Ilya Sutskever 的第一反应是「这正是我们一直在等的东西」。Radford 随即把 Transformer 接到了此前的实验路线上:他使用 BooksCorpus 数据集(包含 7000 多本未正式出版的英文书籍)训练模型做下一个词预测。对他而言,「这两周内取得的进展,比过去两年加起来都多」。

2018 年,这套方法有了正式名字:Generative Pre-trained Transformer,即 GPT。GPT-1 论文共四位作者,Radford 排在第一位。GPT-1 并未立即轰动,但给 OpenAI 指明了方向——不再设计精巧规则,而是把模型、数据和算力规模做大。

参数规模的指数级跃迁

GPT-2 在 2019 年发布,参数从 1.17 亿跃升至 15 亿,训练数据从 7000 多本书扩展到约 800 万网页。论文共有 6 位作者,Radford 仍位列第一,与 Jeffrey Wu 为共同一作。GPT-2 证明:仅靠下一个词预测,模型已能尝试翻译、问答和摘要,并在多项零样本测试中取得不错成绩。

2020 年初,OpenAI 发表《神经语言模型的 Scaling Laws》论文,Radford 也位列作者。同年 5 月发布的 GPT-3 将参数规模放大到 1750 亿,论文作者从 4 人增加到 31 人,Radford 的署名位置退到第 29 位。这一署名变化,恰恰反映了项目性质的变化——它已从 Radford 主导的小规模实验,转变为 OpenAI 调动研究、工程和算力共同完成的大型工程。

从语言拓展到图像与语音

Radford 的研究并未止步于语言。早在加入 OpenAI 之前,他就曾与同事合作发表 DCGAN,把卷积网络引入 GAN 并稳定训练流程,被同行广泛引用。2020 年,他参与发布 Image GPT 和 DALL·E,验证「同一套序列预测方法同样适用于图像」这一假设;同年,他还参与了 CLIP 项目,重新回到共同第一作者的位置。

在语音方向,2020 年的 Jukebox 把音频压缩成离散编码再让 Transformer 生成音乐;两年后的 Whisper 则把这条路线推向更实用的语音识别。Whisper 论文同样由 Radford 担任第一作者,模型在 68 万小时多语言、多口音音频上训练,在多项零样本测试中表现出对真实场景口音和噪声的强鲁棒性。

这些工作的共同主线是:减少人为规定,让数据和算力规模把通用能力「逼」出来。

2024 年离开 OpenAI,押注「断网」实验

2024 年 12 月,Radford 结束了在 OpenAI 近九年的工作,转向独立研究。2025 年 4 月,他与 Nick Levine、David Duvenaud 共同推出项目 Talkie:一个拥有 130 亿参数、基于 2600 亿 Token 训练的古董级语言模型。其预训练语料有一条硬规矩——1931 年 1 月 1 日之后出版的英文材料一律不进。

这一模型只认识蒸汽机、飞机和一战,对电视、互联网、二战及 Python 等「现代知识」一无所知。但研究人员在 HumanEval 编程题上给它看了少量示例后,它竟能写出简单的 Python 代码。这一实验真正测试的是:在从未接触现代计算机知识的底座上,仅靠少量新示例和后训练,模型能以多快速度吸收一项完全陌生的技能。

按照 Radford 一贯的节奏,等外界真正看懂题目时,他本人往往已经转向下一个方向。这一次,他的押注是:在全行业仍在大规模 scaling 的同时,回到一个被「人为截断」的数据分布上,重新审视模型真正在「学」什么。

信源