桃子桃子快讯
返回首页
开源

复古 LLM「Bart」开源:2.82B 参数、20.1B 旧时代语料训练

独立团队 Unbounded Labs 开源复古大模型 Bart,仅 2.82B 参数、基于 1931 年前英文语料训练…

2026.08.25 · 周二3 分钟阅读

独立团队 Unbounded Labs 在 Reddit 上发布了一款名为 Bart 的「复古」大语言模型,仅 2.82B 参数,训练语料全部来自 1931 年以前的英文文本。团队同步开源了训练代码、数据集与配套评测套件 Vintage CORE,整个项目自筹资金完成,总成本约 807 美元。

项目背景与动机

Bart 由 Unbounded Labs 团队历时约 3 个月自筹完成。团队援引 Demis Hassabis 的观点——大模型是否可能得出与历史上伟大科学家相同的结论——作为研究切入点,试图回答语言模型究竟是「产生原创思想」,还是仅仅在「预测下一个 token」。

团队在博客中写道,理查德·费曼那句「我无法创造的东西,我也没有真正理解」是他们的精神指引:通过亲手训练 Bart,他们希望从工程层面深入理解大模型,而不只是停留在阅读论文层面。

模型与训练数据

  • 参数量:2.82B
  • 训练 token 数:20.1B,全部来自 1931 年以前的英文书面文本
  • 训练硬件:单卡 H100,5 天完成训练,全程 MFU 约 60%
  • 后训练:包含完整的 SFT 阶段

在数据处理上,团队对 Harvard Institutional Books 语料进行了清洗,从 242B token 压缩到 23B token;同时构建了目前已知最大的公开复古 SFT 数据集,包含约 41.6 万条基于 1930 年前文本的问答对。

评测方法

由于现有 benchmark 大多面向现代语料,无法直接评估复古 LLM,团队自建了 Vintage CORE——首个由 20 个 benchmark 组成的复古 LLM 评测套件。在该基准上,Bart 在同参数规模下超过了 GPT-1900,且使用了更少的 token 预算。

此外,团队在单卡 H100 上用 10 小时跑了 100 项实验,发现其中 26 项可纳入最终训练方案,体现了其「高效小规模实验 → 最终训练」的迭代思路。

开源内容与后续计划

Bart 的训练数据集、方法论、训练代码、评测体系与训练日志均已开源,最终模型、Vintage CORE benchmark 与复古 SFT 数据集也一并发布。团队表示,资金是制约他们开展更大规模实验的主要瓶颈,正在寻求算力赞助、资金支持以及预训练/后训练方向的导师。

Demo 与完整方法论说明可在其官网博客查阅。

信源