桃子桃子快讯
返回首页
研究论文

arXiv 论文 AI 味检测:CS 领域 65% 中标,数学仅 0.7%

unslop 扫描 12750 篇 arXiv 论文,发现计算机科学 65% 被检测器标为 AI 味,数学仅 0.7%,…

2026.07.27 · 周一4 分钟阅读

unslop 团队扫描了 2023 年 1 月至 2026 年 7 月间的 12750 篇 arXiv 论文,覆盖十个学科领域。检测结果显示,计算机科学领域高达 65% 的论文被判定带有「AI 味」,而数学论文仅 0.7%,学科之间的落差逼近百倍。这项研究将 ChatGPT 时代前后的论文写作变化量化为具体数字,也揭开了 AI 对学术写作深度渗透的现实。

研究方法与核心数据

研究团队从十个学科领域中每月抽取约 25 篇全文,并将 2021 至 2022 年作为对照组——彼时 ChatGPT 尚未面世。

关键发现如下:

  • 对照组阶段(2021–2022),各学科整体 AI 标记率稳定在 0.4%
  • ChatGPT 发布后,标记率在数月内迅速攀升
  • 最近一个完整季度标记率达 32%,2026 年初峰值逼近 39%
  • 计算机科学:65%(ChatGPT 前基准值仅 0.2%,三年增长超 300 倍)
  • 定量生物学:56.3%
  • 电气工程:51.3%
  • 经济与金融:47%
  • 应用物理:34%
  • 统计:31.3%
  • 凝聚态物理:24%
  • 高能物理:14%
  • 天体物理:10.7%
  • 数学:0.7%

研究团队强调,由于检测器无法识别高度隐蔽的 AI 文本,以上数字均为实际比例的下限,真实情况只会更高。

数学仅 0.7%:是坚守还是检测器致盲

数学论文几乎由符号、公式与定理构成,自然语言散文段落极少。而 unslop 的检测器主要分析句式结构、用词习惯与段落组织,对公式密集的数学文本几乎「失明」。

研究团队坦承,数学领域的低标记率存在两种可能:一是数学家确实较少使用 AI 辅助写作,二是检测器对数学论文的判断能力有限,目前的数据无法区分这两种情况。此外,对照组样本量较小(每个学科仅 200 篇 2022 年前论文),误报率仅为粗略估计。

斯坦福研究:越内卷的领域,AI 味越浓

AI 在学术写作中的渗透并非孤例。斯坦福大学 Weixin Liang 团队持续追踪这一趋势:

  • 2024 年 3 月:该团队发现 ICLR 2024 约 10.6% 的审稿意见句子被 LLM 显著修改
  • 2025 年 8 月:样本扩展至 112 万篇论文,研究登上《自然·人类行为》
  • 截至 2024 年 9 月,计算机科学论文摘要的 LLM 修改比例最高已达 22.5%

研究指出,使用 AI 辅助写作最频繁的群体,恰恰是发预印本最活跃、身处最内卷领域的研究者。AI 写作已在部分学科演变为一场「军备竞赛」。

「AI 味」≠ AI 代写:检测器的边界

unslop 团队明确指出,检测器无法区分「AI 仅做语法润色」与「整篇机器生成」,它判定的只是文字中的「机器味」浓度。因此 65% 应理解为「65% 的论文闻起来像 AI」,而非「65% 由 AI 写成」。

更棘手的是,人类的写作风格本身也在向 AI 趋同。有研究者将 ChatGPT 问世前的旧论文输入检测工具,结果 27% 至 74% 的内容被标红——这表明高度规范化的学术措辞容易被检测器误判为机器生成。

「AI 味」成为文字领域的新型标签

随着 AI 写作工具普及,读者对四平八稳、句式工整的文字天然产生怀疑,部分写作者也开始刻意绕开「听起来太 AI」的常用表达。讽刺的是,截至目前,学界对「AI 味」的构成仍未形成可量化的精确定义。

信源