Rocky Linux 创始人推出 OpenWALDO:打造可审计的 AI 训练数据开源底座
Rocky Linux 创始人 Gregory Kurtzer 发起社区治理的开源项目 OpenWALDO,构建带溯源和…
Rocky Linux 与 CentOS 联合创始人 Gregory Kurtzer 近日宣布启动 OpenWALDO,这是一个社区治理的开源项目,目标是建设一份可审查、可追溯、可版本化的 AI 训练数据公共语料库。项目由 Kurtzer 创办的企业基础设施公司 CIQ 提供商业支持,但不由 CIQ 单独控制。
OpenWALDO 全称为 Open Weights, Artifacts, Licenses, Data and Origins,其核心思路是把训练数据当作像开源软件依赖一样管理:命名、审查、版本化、可署名、可验证。项目并不打算自建基础模型,而是提供一套带许可证和溯源的公共语料,让模型开发者可以在此基础上叠加自有数据,纳入自己的训练流程。
核心机制:AI 物料清单(ABOM)
OpenWALDO 的技术方案围绕三个支柱展开:
- 基于 Git 的元数据审查流程,借鉴开源软件开发中成熟的代码评审与 Developer Certificate of Origin 签名机制;
- 内容寻址存储(content-addressed storage)管理底层数据对象,确保数据不可静默篡改;
- AI 物料清单(AI Bill of Materials,ABOM),记录从数据源、许可证、语料筛选、训练运行到模型发布之间的完整血缘关系。
项目官网写道:「没有源代码,AI 就不是开源的。」当企业从公共语料出发、再叠加私有数据训练模型时,ABOM 仍能保留一条可审计的路径,指向最终模型所使用过的全部素材来源。
当前语料规模
公开数据显示,OpenWALDO 公共语料库目前已索引:
- 1240 亿(124B)参考 token;
- 7510 万份文档;
- 20 个语料集合;
- 1,051 个分片(shard);
- 18 个已声明的许可证标识符。
回应行业痛点
OpenWALDO 的发布正逢 AI 开发者、研究者和政策制定者日益关注训练数据的来源与合规问题。项目在公告中援引了 MIT 主导的 Data Provenance Initiative 的审计结果:在其审查的超过 1,800 个文本数据集中,许可证缺失率超过 70%,错误率超过 50%。
此外,项目还把数据溯源视为质量问题。其发布材料指出,递归使用其他 AI 系统输出进行训练(即常说的「模型坍塌」现象)会污染数据质量,而公开的来源记录有助于开发者在训练时甄别和筛选素材。
前景与不确定性
Kurtzer 在声明中表示,他希望把开源软件中「用户变建设者、对手变合作者、共享问题变公共基础设施」的范式带入 AI 领域。他直言:「Linux 不是靠认证安全赢的,而是靠可审查、可分叉、社区验证。AI 缺少同样的属性,OpenWALDO 就是补上这一环的方式。」
不过,文章也点出项目成败取决于多重因素:能否持续吸引高质量且法律可用的数据贡献、能否建立受信任的审查与治理流程、以及能否说服 AI 开发者把溯源记录纳入实际工作流。这些问题将决定 OpenWALDO 能否从一场高调发布走向真正的基础设施。
