AI 评测榜单忽视全球南方,印度案例揭示治理缺失
arXiv 论文指出主流 AI 排行榜缺乏独立治理与利益冲突披露机制,导致印地语等南方语言评测长期缺位。
一篇发表于 arXiv 的立场论文指出,当前主流 AI 排行榜在制度设计上存在结构性缺陷,导致以印度为代表的「全球南方」语言长期得不到有效评测。作者以印度为案例提出,应建立由独立机构治理的区域性排行榜,而非继续依赖缺乏问责机制的全球榜单。
核心论点:问题不在数据,而在治理
论文的核心主张是,阻碍全球南方语言进入主流评测的并非「数据缺失」。事实上,一批针对区域语言的高质量基准早已存在并公开发布,但全球排行榜并未将其纳入,也没有强制性机制推动运营方补齐这些缺口。换言之,瓶颈是制度层面的——榜单缺乏独立治理、缺乏利益冲突披露政策、缺乏指标动态更新机制。
现成的区域基准被「晾」在榜单之外
论文列举了若干已成熟的区域基准,说明评测资源并不匮乏:
- 印度方向:IndicSUPERB、MILU、LAHAJA
- 非洲方向:IrokoBench
- 阿拉伯语方向:AlGhafa
这些基准覆盖了语音、文本理解、低资源语言等关键任务,但它们都没有出现在主流全球排行榜的评测集合中。
印度案例:14 亿人口,22 种官方语言
印度作为案例被重点讨论。该国人口约 14 亿,宪法第八附表列出了 22 种官方语言,本土 AI 研究与基准建设并不薄弱,却长期缺乏一个值得信赖的聚合评测平台。作者对 58 名印度 AI 从业者进行了咨询调查,结果显示受访者普遍支持建立正式治理结构,并倾向于以「信息披露」为基础管理利益冲突,而非依赖运营方自觉。
商业压力的不对称
论文还提出一个关键观察:商业纠偏机制存在地域不对称。当全球北方的付费客户因榜单失真受损时,商业压力会迫使运营方修正;而全球南方的使用者和语言群体缺乏同等议价能力,导致印地语、斯瓦希里语、阿拉伯语等语言在评测中暴露出的失败长期停留在「被记录却无人处理」的状态。
作者建议:从一开始就设计独立治理
作者并非呼吁堆砌更多数据,而是呼吁改变制度设计:区域性排行榜应在成立之初就引入独立治理与利益冲突披露,把「谁来运营、谁有最终评估权」这一前置问题说清楚。这一主张与近期关于 AI 评测中立性、第三方审计的讨论方向一致,但本文的特殊贡献在于用印度这一具体案例与从业者调研为论点提供了实证支撑。
