桃子桃子快讯
返回首页
行业动态

Mollick 谈 AI 研究方法:使用旧模型发论文的五种合规写法

沃顿教授 Mollick 提出,正向 AI 能力结论较稳固,负向结论脆弱,并给出 5 种基于旧模型的可行论证框架。

2026.08.24 · 周一3 分钟阅读

沃顿商学院教授、知名 AI 商业研究者 Ethan Mollick 近日在 X 平台发表长文,聚焦一个困扰 AI 学术研究的问题:当研究者只能拿到旧模型(如 GPT-4)来评估 AI 的社会影响时,应当如何严谨地撰写并发表结论。

AI 能力判断存在「正负不对称」

Mollick 的核心论点建立在 AI 能力演进的不可逆性之上:一旦模型在某个任务上跨过门槛(例如「达到人类水平」),后续世代通常不会回退。因此,依赖旧模型证明 AI 「能完成某事」的研究结论往往具有较好的持久性,依然能成为衡量行业进展的有效基准。

但反向声明则脆弱得多。即便 GPT-4 在某项任务上表现不佳,研究者也无法据此断言「AI 在该任务上有缺陷」——因为下一代模型完全可能克服这一短板。Mollick 明确指出:负向能力声称的「保质期」远短于正向声称,研究者在写作中必须对此向非技术读者说得足够清楚。

五种可发表的论证路径

对于只能基于旧模型展开的实证研究,Mollick 建议作者考虑以下几条可行路线:

  • 明确限定结论边界:直接以「GPT-4 无法完成 X」这样的措辞陈述,并附上足够复现信息,使其成为可对比、可复用的基准数据。
  • 跨代际趋势对比:在实验中同时纳入 GPT-4、GPT-5 及至少一个具备推理能力的模型,对能力演变做纵向刻画,这种方式得出的结论稳健性更高。
  • 论证结构性瓶颈:若能从理论层面说明某项能力存在天然局限,再以实验加以佐证,结论将更耐时间考验。
  • 聚焦调节变量:关注提示方式、社会情境、人机协作等中介因素如何影响 AI 表现,从而把研究价值锚定在「未来需警惕的方向」上。
  • 转向人类视角:把重心放在人类对 AI 的反应、典型失败与成功案例,以及 AI 带来的具体风险与机会上,让结论不依赖单一模型的瞬时能力。

对学术与媒体的启示

Mollick 强调上述框架并非穷尽,但揭示了一个被不少论文忽视的差异:使用旧模型做「AI 表现糟糕」的负面声明,在引用与传播中极易被误读为「AI 普遍失败」。这一观点对当前大量使用 GPT-3.5、GPT-4 评估 AI 在教育、医疗、招聘等领域影响的论文具有现实意义,也为论文评审人和二手报道的读者提供了一个重要的解读参照系:在看到 AI 负面结论时,不妨多问一句——这是「AI 的局限」,还是「这一代模型的局限」。

信源