2.7 万学生追踪 30 个月:AI 让作业分涨 18%,考试却跌 20%
《经济学人》援引学术研究指出,中国中学生使用 AI 后作业提分、用时缩短,但闭卷考试下滑约 20%,惩罚效应在两年内持续…
核心发现:作业涨分,考试失分
2025 年 8 月 18 日,《经济学人》披露了一项基于中国某县城 26811 名初高中生的长期追踪研究。数据显示,使用 AI 的学生作业平均分提升约 18%,单次作业用时从 64 分钟缩短到 45 分钟。然而在闭卷月考中,这批学生的成绩比未使用 AI 的同学低了约 20%,相当于 1.4 个标准差的下滑。研究覆盖 5 所初中与 4 所高中,跟踪周期为 2022 年 9 月至 2025 年 6 月共 30 个月,作业提交与考试成绩均通过线上系统自动记录,AI 使用情况来自回收率超 96% 的全员问卷。
研究底稿来自斯德哥尔摩大学与香港大学三位经济学家 6 月在 SSRN 挂出的论文《生成式 AI 学习惩罚》。采纳曲线在 2022 年 9 月几乎为零,到 2025 年 6 月攀升至 80%,两次显著跳升分别落在 DeepSeek V2.5 与 R1 发布节点,学生常用的工具包括豆包、DeepSeek、文心一言与通义千问。
分学科表现与人群差异
惩罚效应在各学科并不均匀:
- 社科类跌幅最大,约 27%
- 数学次之,约 22%
- 英语约 17%
- 语文最轻,约 9%
初中生受到的冲击比高中生高约四成,男生跌幅大于女生。更值得注意的是,成绩原本较好的学生跌得最狠:作业分超过 100 分的群体中,未用 AI 者成绩继续上行至 112 分,而深度使用 AI 者一路跌至 64 分。
升学考试的效应同样显著,但需要谨慎解读。传播最广的「中考暴跌 24%、高考暴跌 18%」仅适用于使用 AI 满两年以上的群体;全体 AI 用户的平均惩罚约为 7%。论文作者特别指出,短期研究会系统性低估 AI 的学习成本,因为惩罚需要两年时间才完全显现。
「好好用 AI」的脆弱性
论文曾给出一个看似安慰的结论:约两成学生用 AI 但不外包作业,成绩并未受损。「外包」的数值定义是作业用时少于 45 分钟,而 50 至 65 分钟区间内,两类学生成绩几乎相同。然而深入分析发现,使用满 5 个月后,外包比例从 58% 升至 81%,完全外包从 34% 升至 50%。那些原本花 65 分钟以上认真写作业的「模范用户」,几乎全部是上手不到 5 个月的新人。使用满 6 个月后,样本中没有一名 AI 学生的作业用时仍超过 65 分钟。这意味着「合理使用 AI」并不是一种稳定状态,而是一个维持不到半年的过渡阶段。
成年人的相同曲线
类似模式在过去一年多已在不同职业群体中被重复观测。
- 医疗领域:《柳叶刀·胃肠病学和肝病学》去年 8 月发表的波兰研究中,19 名资深内镜医生在使用 AI 辅助数月后脱离 AI,腺瘤检出率从 28.4% 跌至 22.4%,相对下降 20%。
- 写作领域:MIT 媒体实验室去年 6 月的脑电实验显示,使用 ChatGPT 的学生神经连接强度比纯独立写作组低最多 55%,83% 的学生在写完后无法复述自己文章中的一句话,这一现象被命名为「认知负债」。
- 办公场景:微软研究院与卡内略隆大学对 319 名知识工作者的调查显示,对 AI 输出越有信心的人,自己核查的投入越少。
- 编程领域:METR 去年对照实验发现,资深程序员使用 AI 后实测变慢,却主观感觉快了 20%;今年 2 月的复测因多数开发者拒绝无 AI 工作环境而未能完成。
认知卸载与「没有月考」的成年人
论文将这一现象归因于「认知卸载」:本该在脑中运行的推演、试错、打草稿过程被外包给 AI。学生每月有闭卷考试作为检验,因此曲线被摆到台面;而大多数成年人的工作缺乏这种强制 Debug 机制,能力下滑往往被掩盖。
论文也留出一定余地:拉长时间看,惩罚效应正在收窄,同样用满 5 个月的学生,2023 年初平均损失 25%,到 2025 年 6 月降至 16%。工具侧的改进(如强制 AI 展示推演过程)以及师生适应都在起作用,但作者判断损失趋小却未见归零。9 月 1 日开学后,这场 26811 人的实验将以更大样本再次启动。
