桃子桃子快讯
返回首页
行业动态

破折号成了 AI 文本指纹?

文章指出 em dash 因键盘输入不便,在人类日常写作中本就少见,而大模型训练语料偏向编辑过的文本,导致其反复使用该符…

2026.07.24 · 周五4 分钟阅读

过去几个月里,一个原本不起眼的标点符号正在变成识别 AI 生成文本的「指纹」:em dash(长破折号——)。打开 Slack、翻一篇 Notion 文档、在 LinkedIn 上刷半分钟,几乎都能撞见它一而再、再而三地出现在句子中间,扮演着原本由逗号或句号就能完成的停顿角色。它的出现频率已经高到不再像风格选择,而更像一种「烙印」。

普通人几乎不打的字符

em dash 之所以得名,是因为传统排印中其宽度被设定为一个 em——也就是给定字体里字母 M 的宽度,约为 en dash(短破折号)的两倍。它并不新:早在 1588 年,Maurice Kyffin 翻译泰伦斯的《安德利亚女子》时,就已用一串连字符标记被打断的台词;后来同剧的多个英译本沿用了这一做法。最终,昂贵的对开本版本统一采用单一长破折号取代连字符串,主要是为了版面的整洁。

此后数百年里,em dash 一直是编辑出版业的「职业标点」:小说、散文、新闻业、《芝加哥风格手册》、《美联社风格手册》都对其有明确规定。美式写法两侧不留空格,英式与加式风格则倾向于用留空的 en dash。无论哪种规范,它都属于排字工人和编辑,而非日常随手敲键盘的人。

关键在于:几乎没人方便打出它。标准键盘只提供连字符一个选项。要在 Mac 上输入真正的 em dash,需要 Option+Shift+Hyphen;在 Windows 上得用 Alt 码;过去在等宽打字机字体里没有现成字形,只能靠敲两个连字符替代。这意味着,想用 em dash 的人要么记住快捷键,要么依赖自动更正把双连字符替换掉,要么干脆放弃,改用逗号。正因为这点微小摩擦,在未经编辑的人类日常书写中,em dash 长期保持着稀有的状态。

大模型为何停不下来

大语言模型的学习起点恰好与此相反。它们读的是书籍、学术论文、编辑过的新闻报道——这些文本里 em dash 随处可见,因为对职业写作者而言它毫无输入成本,也没有让普通用户却步的那种摩擦。这种训练数据让模型形成了「认真写作就该长这样」的印象,于是它会一次又一次地伸手拿同一个工具,无论内容是否真的需要停顿或插入语。

模型缺少的是人类编辑拥有的那种「自我审视」:作者写多了会注意到自己太依赖某个短语,并主动删减;模型则是一个 token 一个 token 地生成,根本不会记得三段之前自己已经用过同一种修辞多少次。没有任何机制训练它去察觉自己的习惯,也就没有任何东西提醒它停下。

它为何会被读作「指纹」

把上述两点叠在一起,em dash 就失去了「中立标点」的身份。一个在 DM 里快速打字的人,不会特意去敲一个需要组合键才能打出的字符——他们只会用连字符、逗号,或者干脆什么都不加。一段文字里反复出现不带空格的长破折号、且每次都做着同样的修辞工作,这并不符合人类在正常条件下的打字习惯。它看起来是什么,就是什么:模型生成、未经改动的文本。

这背后真正的问题

首先是信任问题。一条 Slack 私信或一篇 Notion 页面,如果通篇都是这种「模型腔」,会让人感觉发消息的人根本没有亲自为内容负责。发信人若不是自己写的,那他是真的想过这件事,还是只是让模型代笔、再把回复原样转出去?消息不再证明一个人的判断力,反而开始证明判断力被外包了。

自己动手写几句话,哪怕只是两三句,也是对读者一点小小的用心。把模型输出连同破折号一起原样粘贴、不做任何让它「像你」的修改,等于告诉对方:你觉得这条消息不值得花这点时间。人们会注意到这一点,哪怕说不清原因。

在更慢、更不易察觉的层面,还有「同质化」问题。当团队里足够多的人依赖同一个工具去生成同一种语气,每条 DM、每个项目更新、每篇 Notion 文档听起来都会像出自同一个人——而那个人其实是「没有人」。团队文化一部分正藏在成员之间实际交流的方式里:行话、语气、个人特有的怪癖。把这一切抹平为同一种圆滑、留有余地、密集使用破折号的节奏,就会丢掉某些一直在默默发挥作用的东西——即便当时没人把它叫作「文化」。

在把任何输出发出去之前,先读一遍、改掉那些不像自己的部分。一个会替你代笔 Slack 和 Notion 的工具,悄无声息地,也在替你的声誉代笔。这件事值得在它变成默认动作之前,先注意到。

信源