研究:LLM 反复生成的假名已污染学术数据库
三星与华沙大学研究显示,主流大模型在虚构专家时反复使用同一批假名,Zenodo 上已出现 1655 条幽灵作者记录。
三星与华沙大学的研究人员发表预印本论文,揭示了一个有趣且令人担忧的现象:主流大语言模型在生成「专家」时,会反复使用同一批并不存在的姓名,而这些人名已经污染了多个学术数据库,包括 CERN 运营的 Zenodo 仓库。
研究发现:LLM 的「命名偏好」
论文题为《The Ghost Couple: Correlated LLM Name Priors and Their Haunting of the Web and Academic Publishing》,指出 ChatGPT、Gemini、Claude 等模型在虚构专家时存在高度趋同的命名模式。例如,模型在生成虚构小说角色时常使用「Elias Thorne」,而要求其生成软件开发者则常得到「Marcus Chen」。
研究团队进一步发现,模型不仅会重复单个姓名,还会产生「关联角色群」,即某些名字倾向于一同出现。除上述名字外,Claude 偏好使用「Elena Amara Okafor」,Gemini 偏好「Aris Thorne」与「Lena Petrova」,ChatGPT 则常生成「Elara Voss」。
污染规模:1655 条幽灵记录
最受关注的名字之一是「Elena Vasquez」。此前 404 Media 曾报道的 Research Gold 公司即以该名作为「首席方法学家」,其所谓「人工医学研究」实为 AI 生成。研究论文显示,团队在 Zenodo 上识别出 1,655 条由这些幽灵作者署名的记录,它们声称发表在不存在的期刊上,出版日期也被伪造。
更严重的是,这些记录都带有真实可用的 DataCite DOI,能够被任何学术聚合器收割。研究团队在 ResearchGate 上也发现了由这些名字组成的「合成研究小组」,成员来自多个模型家族的命名偏好,并被 Google Scholar、Semantic Scholar 无验证地收录索引。研究人员写道:「大规模污染学术记录的基础设施已经就位,学术档案正在被悄悄纠缠。」
溯源可能与局限
研究人员认为,不同模型及版本生成特定名字的一致性足够高,因此有望据此判断一段 AI 内容的来源模型。例如,「Elena Vasquez」在 Claude Sonnet 4 生成的内容中尤为常见,因此署名她的论文大概率由该模型生成。
论文第一作者 Michał Brzozowski 同时指出,这一溯源方法的准确性可能难以持久——因为由这些名字生成的 AI 内容正大量涌入互联网,反过来又成为所有模型训练数据的来源,形成反馈循环,使名字与模型的关联逐渐模糊。
学术出版体系的连锁挑战
学术出版领域早已在应对 AI 内容的冲击:科学期刊曾发表 AI 生成文本,AI 也正在影响同行评审流程,预印本平台 arxiv 已宣布对提交 AI 生成作品的作者实施一年封禁。这项研究的新意在于,它提供了一种可量化的、基于「命名指纹」的检测路径,有望帮助期刊、平台与搜索引擎识别低质量 AI 生成内容,也为判断一段文本究竟来自哪一代、哪一款模型提供了新的间接线索。
