10 万人 vs 九款大模型:GPT-4 平均分夺冠,最有创造力的人仍领先 AI
蒙特利尔大学等团队在《Scientific Reports》发表迄今最大规模人机创造力对比研究,10 万人与九款主流大模…
一场四分钟的「写十个不相关名词」小游戏,把 10 万名人类和九款主流大模型放到了同一张成绩单上。结果显示:GPT-4 的平均分超过了人类均值,但创造力最强的前 10% 人类,依然领先所有被测模型。这项研究于 2026 年 1 月发表在《Scientific Reports》上,由蒙特利尔大学认知神经科学家 Karim Jerbi 领衔,图灵奖得主 Yoshua Bengio、魔术师兼心理学家 Jay Olson、Google DeepMind 的即兴喜剧研究者 Kory Mathewson 等共同参与。
研究设计与参赛选手
这场对比用的是 2021 年发表在《美国国家科学院院刊》上的「发散联想任务」(Divergent Association Task,简称 DAT)。规则很简单:写下 10 个英文名词,彼此语义距离越远越好。十词两两之间的平均语义距离即为得分。评分由算法自动完成,绕开了传统创造力测评中评委标准不一的问题。
被测的九款模型涵盖 GPT-3.5、GPT-4、GPT-4-turbo、Claude 3、Gemini Pro,以及 Vicuna 等四款开源小模型。它们与 10 万名年龄覆盖 18 至 60 岁以上的人类答卷在同一坐标系下排名。
关键结果:平均分赢的是机器,极高分赢的是人
按默认设置答题,九款模型的平均分排名如下:
- GPT-4:平均分最高,显著超过人类均值;
- Gemini Pro:与人类平均分无显著差异;
- 其余七款(含 Claude 3):均低于人类平均。
然而,把 10 万人按分数排序后画分布图,情况发生变化:前 50% 人类的平均分仍高于所有模型;前 10% 人类与模型的差距进一步拉大。每款模型的分数都集中在很窄的一段区间内,而人类的分数从 30 一直铺到 95 以上,右端高分区没有一款模型够得着。
研究者还挑选 GPT-3.5、Vicuna 和 GPT-4 加测了三道写作题——俳句、电影故事梗概、微型小说。方向一致:机器写得有模有样,但始终不及最会写的那批人。
值得注意的是,GPT-4 的后继版本 GPT-4-turbo 得分反而比前辈低了不止一截,甚至不如规模更小的 Vicuna 和 GPT-3.5。至少在这批模型上,参数规模与版本新旧并不直接换算成创造力分数。
温度与提示词都能拉分
模型分数并非一成不变。研究者做了两项干预实验:
- 调温度:把 GPT-4 的温度从 0.5 升到 1.5,分数随之上行,最高档平均分达到 85.6,超过 72% 的人类答卷;
- 改提示词:加入「从词源入手找不相关词」的指令,GPT-3.5 和 GPT-4 的成绩均超过原版指令;换成「查同义词典」的提示,分数几乎不变。
研究者在论文中由此指出,提示与交互本身已成为创作过程的一部分。
四路质疑
学界对这类测评的怀疑从未停止,主要集中在四方面:
- 题目本身:创造力通常要求「又新又有用」,DAT 能衡量发散程度,却无法衡量「有没有用」,出题人 Olson 在原论文中已承认这一点;
- 答案趋同:不同公司出品的模型答起题来高度相似,2025 年的一项研究指出,模型彼此答案的相似度远高于人与人之间的自然差异;
- 数据污染:DAT 题目公开可查,无法排除模型训练数据中已包含这些题目或近似内容;
- 测验条件偏差:2025 年的重做实验表明,只要给人更多时间、把题目要求写清楚,人类就能追平机器,原先差距部分来自条件设置。
结论与展望
在「限时想出一批不落俗套的联想」这一狭义任务上,最强模型的平均分已超过人类均值,但创造力最强的那批人类依然领先。Jerbi 在新闻稿中表示,与其纠结 AI 是否替代人类创作者,不如把它当作创造力的工具——它将如何改变创作,取决于下一批研究,也取决于使用它的人。
读者如果好奇自己的排名,DAT 测验官网 datcreativity.com 目前仍开放,四分钟即可出分。
