呼吁AI模型走向开放权重、开放源码、开放语料
评论文章呼吁在开放权重之外,进一步推动AI模型源码与训练语料开放,并反思版权与公平使用议题。
英伟达 CEO 黄仁勋近日在社交平台发布简短公开信,呼吁美国投资围绕开源人工智能构建「强大的开放生态」。包括谷歌、Meta、微软等在内的几乎所有大型科技公司 CEO 迅速在信上署名,仅 Anthropic 一家缺席。这一动向被业界视为美国科技界就开放权重 AI 达成罕见共识。在此背景下,一位长期推动开源 AI 的开发者撰文呼吁:仅仅开放权重还不够,业界需要更进一步,把模型源码乃至训练语料一并开放。
算力并非真正的护城河
文章作者承认,训练优秀语言模型需要「人才、算力、数据」三要素,且每一项都需要极大投入,人才已经不是问题。但对于算力,作者反驳了超大规模云厂商「数据中心即护城河」的说法。他以中国公司的实践为例进行说明:
- DeepSeek 与 Moonshot(Kimi 母公司)推出的模型,业内普遍估计训练成本不到一千万美元。
- 与之相对,许多缺乏清晰技术路线的「NeoLabs」类 AI 创业公司,却从风投机构拿到超过这一数字十倍的资金。
- 真正有眼光的 VC 可以通过组建开放生态产业联盟来分摊成本,单个成员分摊费用相对于其资金储备几乎可以忽略不计。
作者认为,中国开源模型已经在「低成本训练」这件事上撕开了西方超大规模厂商讲的故事。
从开放权重到开放源码
作者引用「摩擦式可复现性」(frictionless reproducibility)这一概念论述开源机器学习的优势:在开放环境中,研究、代码与数据可被反复评估和迭代,模型不仅会更强,也会更快变得更高效。文章以 ImageNet 模型为例:
- 早期高性能 ImageNet 模型只能在 Google 这样的大公司内部训练;
- 不到一年,同样的训练就可以在桌面电脑上完成。
这种效率跃迁贯穿 2010 年代。但进入 2020 年代后,主要实验室普遍转向封闭,作者认为这一转变虽然产生了令人印象深刻的模型,却损害了更广泛的工程领域。他主张:模型权重应该开放,更重要的是训练代码、训练方案也应该开放。
开放语料:更艰难的命题
文章将「数据」称为难题中的难题,并提出比开放源码更激进的主张——「开放语料」(open corpus)。核心论点是:
- 诉讼材料显示,大模型公司使用盗版图书库、学术论文、版权图像进行训练,这一点公司自己也已经在论文中承认。
- 训练数据同时来自维基百科、Reddit、GitHub 公开代码、YouTube 视频字幕等社群协作成果。
- 海量集体创作被「搅拌」进专有软件以服务少数公司盈利,这是不好的结果。
- 公司主张训练行为属于「转化性使用」,构成合理使用。如果这一逻辑成立,那么「蒸馏」(用大模型输出训练小模型)也应当被允许。
作者因此呼吁,推动开放语料意味着需要重新审视知识产权与创作者报酬问题,给予开放模型与闭源模型一个公平的起点。
行业共识已形成,行动是关键
文章最后承认上述主张面临三重困难:吸引年轻人关心开源而非追求财富、说服亿万富翁以非赢者通吃的方式协作、以及就版权与合理使用展开漫长讨论。但作者认为,在 ChatGPT 之前,开放生态本就繁荣,封闭时期还不到半个世纪,既然整个科技行业已表态支持,正是把一切重新开放的时机。
