医学生论文被指 AI 代写:一场因标点与语感引发的学术争议
英国圣安德鲁斯大学一名医学生因论文被怀疑由 AI 生成而遭学术听证,最终通过申诉翻案,折射 AI 检测在高校中的局限。
英国圣安德鲁斯大学医学院 20 岁学生 Harrison Sharples 去年夏天耗时完成了一篇关于游戏治疗对住院儿童焦虑影响的毕业论文,却在 8 月收到学术不端警报:两位人工评审中有一位认为论文存在 AI 生成嫌疑。随后他出席了一场虚拟听证会,因会议链接迟到未能充分陈述,最终被判违规、成绩上限封顶为 7 分,且将记录在英国医学总会(GMC)的职业档案中。他随后提起申诉,校方承认听证程序存在瑕疵,第二次听证后撤掉了指控,他才得以拿回完整分数并如期毕业。
事件经过
Sharples 在接受 BBC 采访时表示,他从未考虑过使用 AI 工具协助写作,因为时间充裕且享受写作过程,并坦言自己常常「忘记这是可选项」。然而他在 8 月收到学校的学术不端通知,论文被指存在 AI 生成的特征,并被安排参加一场线上听证会为自己辩护。
更让他措手不及的是,听证链接在他多次联系后才在原定开始 5 分钟后送达。他在紧张状态下完成了约半小时的问答,一周后收到维持违规判定的结果,并被告知将记录在 GMC 职业档案中。Sharples 随即提出申诉,理由是听证程序影响了他的正常发挥;学校认可这一程序问题,邀请他参加 11 月中旬的第二次听证,最终撤回了指控。
不过这一折腾让他不得不推迟一学期考试、毕业时间延至当年 12 月。他形容整个学期都被焦虑占据,「脑子里几乎装不下别的事情」。
评审眼中的「AI 痕迹」
BBC 获得了评审的书面意见。评审列出的可疑特征包括:
- 「打磨过且高度统一」的文风,全文语法近乎完美且句式雷同,缺乏风格变化;
- 段落结构呈典型 AI 模板:先抛出一般性论点,再给例证或结果,最后收束;
- 措辞重复、缺少「细致的批判性分析」;
- 大量使用 em dash(—),被视作大模型偏爱的标点。
这些「嫌疑点」并不依赖任何 AI 检测工具,而纯粹来自人工评审的语感判断。Sharples 在二次听证中被问到的是写作思路和方法论,而非医学概念本身,他也因此得以更从容地展示自己的原创性。
AI 检测的局限与反思
AI 伦理顾问 Sidrah Hassan 在受访时指出,大语言模型正以「光速」迭代,高校难以跟上节奏。她认为,虽然 AI 输出有一些共性信号可被识别,但现有的 AI 检测工具并不鲁棒、误判率较高。
Hassan 进一步表示,仅靠抓学生使用 AI 并不是面向未来的解法:「我们应该改变考核方式,因为人类总会倾向于寻找更省力的路径。」圣安德鲁斯大学也在声明中回应称,不就个案细节置评,但确认本次申诉成功仅与听证安排上的程序问题有关,并强调学校及行业层面正在推动 AI 在学术工作中的负责任使用,包括医学领域。
Sharples 的遭遇并非孤例。随着生成式 AI 普及,「像不像 AI」正逐渐成为评审打分时的一种隐性维度,而检测工具的不成熟与人工判断的主观性,也在让更多学生面临类似的误判风险。
