桃子桃子快讯
返回首页
开源

Percy Liang 谈 Marin 开源项目:数据流水线已产出 25T tokens

斯坦福 Percy Liang 介绍 Marin 项目的可扩展数据基础设施,可对开源数据集进行去重、去污染与混合,产出…

2026.09.24 · 周四2 分钟阅读

斯坦福大学知名 AI 研究者 Percy Liang 近日在社交平台 X 上介绍了其参与的 Marin 项目,强调该项目对开源社区的坚定信念。据其介绍,Marin 团队构建了一套可扩展的数据处理基础设施,能够从 Hugging Face 等平台汇集大量开源数据集,并依次完成去重(deduplication)、去污染(decontamination)与混合(mixing)等关键步骤,最终产出规模达 25T tokens 的训练语料。

强调开源协作的价值

Percy Liang 在发言中明确表示,Marin 团队坚信开源社区的力量。目前社区中已经沉淀了大量数据集,这些资源为大规模语言模型训练提供了重要支撑。Marin 的目标并非重新造轮子,而是把分散在 Hugging Face 等平台上的已有数据集系统地整合、处理并开放出来,让更多研究者能够复用高质量的训练语料。

数据处理的关键环节

据透露,Marin 的数据流水线包含以下核心步骤:

  • 去重:消除数据集中的重复样本,提升训练效率与数据多样性。
  • 去污染:过滤掉可能与常见评测基准重叠的内容,减少数据泄漏风险。
  • 混合:将不同来源的数据按比例混合,平衡各领域语料的覆盖。

经过这套流程处理后,最终产出的训练数据规模达到 25T tokens,对于一个由学术团队主导的开源项目而言,这一规模相当可观。

意义与局限

Marin 项目体现了学术界在数据基础设施层面推动开源的努力,与近期一系列以「开放权重 + 开放数据」为核心的项目形成呼应。对于希望复现或训练自有模型的研究者和中小团队来说,这样一套可复用的数据处理流水线具有实际价值。不过,目前披露的信息仍较为有限,关于训练目标、最终模型规模与具体技术报告等细节尚未公开,后续值得持续关注。

信源