桃子桃子快讯
返回首页
行业动态

AI 为何在你的语言上表现更差:训练数据、分词与指令微调三重不对称

AI 在非英语场景的退化不取决于语言学难度,而取决于训练数据占比、分词器效率与指令微调覆盖三个工程因素。

2026.07.24 · 周五5 分钟阅读

AI 模型在英语之外的语言上系统性表现更差,问题并非来自语言学层面的难度,而更多源自训练数据占比、分词器效率与指令微调覆盖这三重工程性不对称。其中前两项是建模范式的「意外副作用」,第三项则直接让非英语推理的 token 成本高出 3 到 4 倍。理解这三件事是评估任何所谓「多语言模型」可用性的关键起点。

性能差距到底有多大

把英语与非英语混为一谈会严重低估差距的实际量级。在企业级检索任务中,使用相同语料库和同一模型时,英语与非英语查询之间的准确率落差可达 29 个百分点。换成具体场景,就是同一套系统在英语环境下十问九对、在其他语言环境下十问只能答对六七次。

在资源分布的另一端,这种差距几乎触底:对部分美洲原住民语言的测试中,模型在三项分类任务上的准确率仅约 38%,而随机猜测是 33%。也就是说,模型不是在「表现不佳」,而是在以猜测的水平运行——它几乎不具备在这些语言上完成任务的能力。

在这两极之间的大多数语言上,规律高度一致:性能跟随资源可用性走,而资源可用性跟随这门语言在可抓取公网文本中的占比走,后者又和财富、殖民历史相关,却与实际使用者人数几乎无关。孟加拉语使用者约为德语的四倍,但其在公网语料中的数字足迹却远小于德语。

「说的人多」为何毫无预测力

这种错配值得多停留几秒,因为它驱动了绝大多数不平等待遇。孟加拉语约有 2.5 亿使用者,数字足迹却小于人口只有其十分之一的若干欧洲语言。西非的豪萨语、约鲁巴语与伊博语合起来覆盖西非相当大的人口,但在被抓取语料中出现的频率却暗示它们只是「爱好者使用的小众语言」。与此同时,使用者只有几十万人的冰岛语却获得了较好的支持,原因在于冰岛富裕、网络化且对语言技术做过定向投入。

语料衡量的从来不是「多少人在说这门语言」,而是「这门语言有多少文本被发布到公网」。后者取决于互联网渗透率、标准书面语的识字率、出版产业是否存在、正字法是否稳定,以及使用者是否在网上就用这门语言书写,还是只要敲键盘就切换到某门殖民语言。在很多多语言社会中,人们说一种语言、写另一种语言,或用拉丁化的形式书写自己的母语,而标准语料完全识别不出——数字记录系统性低估了人们实际使用的语言,模型则继承了这种低估。

真正影响模型表现的三个因素

三个因素,没有一个和语言学复杂度有关。

  • 训练数据占比:决定性因素。一门语言在预训练语料中的占比,近似等于它在公网文本中的占比,后者极不均衡。世界语言的常用分级把绝大多数语言塞进底层,留下顶端的几门语言覆盖绝大多数语料。
  • 分词器效率:下面单列一节,因为它最不被理解、最直接抬升成本。
  • 指令微调覆盖:预训练是宽覆盖的,把一个文本预测器改造成「会听话」的指令微调阶段通常窄得多。这产生一种特别反直觉的失败:模型明明听懂了你的语言、也能用这门语言流利作答,却完全忽略了你真正下的指令——理解迁移了,指令遵循没有。

列在列表外但值得明说的是:形态复杂度、书写方向、黏着性、声调——这些维度都不能稳定预测模型表现。芬兰语和土耳其语形态极复杂,模型却处理得尚可,因为有足够的芬兰语和土耳其语文本。难的是数据问题,只是披着语言学的外衣。

「分词器税」:把意外当成了语言的天性

这是让很多从业多年的人都感到意外的部分,也是把可修复的工程意外误读为语言固有属性的最典型例子。模型读的不是字符,而是 token:由训练语料中相邻字符对的频率学出来的子词词表切出来的片段。常见英文单词往往一个 token 就搞定,其余语言则被切得支离破碎。

由于合并规则是从以英文占绝对多数的文本中学出来的,非英语脚本会被切得更碎、更长的字符序列才能表达同一段语义。这意味着同一段对话在非英语下消耗的 token 更多,推理时延更高,账单更贵——典型的「分词器税」可达非英语场景相比英语的 3 到 4 倍成本差。这不是语言难学,而是词表的统计偏好恰好不利于这门语言。

哪些是结构性问题,哪些其实可以修

把可修复的部分识别清楚比笼统喊「AI 偏见」更有用。在上述三件事里:

  • 训练数据占比是可修复的,但需要大规模多语言抓取、本地化合作与定向数据生产,属于重资产工程;
  • 分词器效率高度可修复,重新训练或扩充分词词表、对小语种做专门适配,已是行业正在做的事;
  • 指令微调覆盖最容易被忽视,也最容易修复,因为只需要把高质量指令数据补齐到目标语言,但多数实验室仍以英语指令数据为主。

真正难以修复的是其余结构性因素:殖民史留下的数字足迹不平权、正字法尚未稳定的语言、使用者在网上就用其他语言书写的现实。但即便不动这些根因,仅靠补齐指令微调与优化分词器这两项工程,非英语场景的可用性就会有数量级的提升。结论是:AI 在你的语言上表现更差,主要原因不是这门语言难,而是它没被认真对待过。

信源