桃子桃子快讯
返回首页
开源

Hugging Face 开源 The Stack v3 代码数据集

Hugging Face 发布 The Stack v3,提供 train 与 full 两种版本,总量达 114 TB…

2026.07.24 · 周五3 分钟阅读

Hugging Face 通过其核心成员 Anton Lozhkhov 在社交平台宣布,正式发布 The Stack v3 开源代码数据集。该数据集延续了 The Stack 系列面向代码大模型训练的传统定位,被官方描述为「迄今最大」的开源代码语料,总量达到 114 TB,可直接用于训练、微调以及评测代码相关模型。

两个版本覆盖不同使用场景

The Stack v3 提供了两种互补的获取方式,分别面向「即取即用」和「自建处理管线」两类用户:

  • stack-v3-train:经过近重复去除(near-deduplicated)、质量过滤、PII 文本脱敏处理,且文件内容已内联(contents inline),用户可直接通过 load_dataset 接口加载使用,适合快速进入训练流程。
  • stack-v3-full:完整保留 114 TB 原始语料,以 HF Storage Bucket 形式提供,包括所有重复样本及其聚类 ID,以及被排除文件的占位记录(stubs),方便研究人员自行进行去重、过滤和数据配比。

两个版本地址分别为:https://huggingface.co/datasets/HuggingFaceCode/stack-v3-trainhttps://huggingface.co/buckets/HuggingFaceCode/stack-v3-full

对开源代码模型训练的关键意义

代码语料的规模与质量直接决定了代码大模型在补全、生成和推理任务上的能力上限。The Stack 系列此前已被 StarCoder、CodeLlama 等多个知名开源代码模型采用为训练数据来源,是开源社区构建代码模型的事实标准底座之一。

The Stack v3 在规模上达到 114 TB,并通过 PII 脱敏和近重复去除等环节提升了数据可用性与合规性,对依赖开源代码训练的研究团队和个人开发者而言,是一个可显著降低数据准备门槛的公共资源。同时,full 版本开放完整原始语料和聚类信息,让对数据配比有精细需求的团队能够在此基础上做二次加工。

使用建议与注意事项

对于希望快速复现或发起新训练的用户,建议优先使用 stack-v3-train,跳过清洗管线即可直接消费;对于需要自定义许可证筛选、采样比例或与企业级代码库做混合训练的研究者,stack-v3-full 提供了更高自由度,但需自建去重与过滤流程。

由于 Hugging Face 目前仅透露了发布与大版本划分信息,关于数据集涵盖的具体编程语言分布、许可证构成、token 总量等更细粒度的统计指标尚未在官方说明中给出,后续可在官方文档与数据集卡片中持续关注。

信源