研究论文
泰国团队基于 Ai2 Dolma 工具包构建 470 亿 token 泰语语料库
泰国研究团队改造 Ai2 的 Dolma 数据整理工具,打造 470 亿 token 的泰语语料库 Mangosteen…
2026.08.27 · 周四约 2 分钟阅读
Ai2 在 X 平台宣布,泰国一个研究团队基于其开源的 Dolma 数据整理工具包,构建了名为 Mangosteen 的泰语语料库,总规模达 470 亿 token。研究团队将 Dolma 的过滤与清洗流程应用于多个常用网页数据集,从中筛选出更高质量的子集,用于泰语大模型的训练。
Mangosteen 的构建思路
Dolma 是 Ai2 推出的大规模预训练数据整理工具包,原本面向英文等高资源语言设计,支持数据过滤、去重、质量评分等环节。泰国研究团队对该工具链进行了适配与改造,使其能够处理泰文特有的分词、字符集以及网络文本特征。
- 数据来源:在多个公开网页语料的基础上进行筛选
- 工具链:基于 Dolma 的过滤流程做定制化调整
- 产出规模:最终得到 470 亿 token 的泰语专用语料
用更少数据取得更好表现
据 Ai2 介绍,使用 Mangosteen 训练的泰语大模型,相较于直接使用未经筛选的原始网页数据,在相同或更小数据量下取得了更优的下游任务表现。这意味着在泰语这类相对低资源的语言场景中,数据质量比数据规模的边际收益更高。
对非英语 LLM 训练的启示
Mangosteen 的实践再次验证了「高质量过滤 + 适度规模」对中小语种大模型的重要性,同时也展示了 Dolma 这类通用数据工具向其他语言迁移的可行性。对于正在推进中文、东南亚语言或其他低资源语言大模型研发的团队而言,该工作提供了一条可复用的数据工程路线。
目前 Ai2 仅在 X 平台以线程形式简要介绍了该项目,更多技术细节、过滤策略与评测结果有待后续论文或博客披露。
