桃子桃子快讯
返回首页
研究论文

Ai2 发布 470 亿 Token 泰语预训练语料 Mangosteen

Ai2 推出 470 亿 Token 泰语预训练语料 Mangosteen,经精细清洗去重后训练的模型可媲美使用更大规模…

2026.08.27 · 周四1 分钟阅读

Ai2(Allen Institute for AI)近期公布了名为 Mangosteen 的泰语预训练语料库,总规模达 470 亿 Token。研究团队在数据构建过程中对原始网页文本进行了系统性的清洗与去重,重点去除了低质量内容与重复文本。

数据规模与训练效果

基于 Mangosteen 训练出的泰语模型,在多项泰语任务上的表现能够匹配甚至超越那些使用更大规模、未经精细筛选的网页数据训练的泰语 LLM。这一对比结果说明,在预训练阶段对语料进行精细策展,可以用更少的数据获得同等甚至更好的模型质量,挑战了「数据越多越好」的传统假设。

对低资源语言研究的启示

泰语在主流大语言模型的训练语料中占比偏低,属于典型的低资源语言。Mangosteen 的实践表明,针对特定语言构建高质量、经过严格策展的预训练语料,是提升模型本地化能力、缩小语言鸿沟的有效路径之一。该语料的发布也为后续泰语 LLM 的研究与开发提供了可复用的数据基础,相关论文可通过原帖链接查阅。

信源