桃子桃子快讯
返回首页
开源

开发者发布 150M 参数小型语言模型 BetterGPT-150M

个人开发者完成 BetterGPT-150M 预训练并在 Hugging Face 开源,声称基准测试优于 GPT-2…

2026.07.29 · 周三2 分钟阅读

一位独立开发者在 r/LocalLLaMA 社区发布了自研的紧凑型因果语言模型 BetterGPT-150M,模型权重、推理仓库与在线 Demo 均已在 Hugging Face 开放下载与试用。该模型参数量约为 1.52 亿,使用 15B token 语料完成预训练,并提供了从训练到评测的完整资料,面向轻量级本地推理与边缘设备实验场景。

模型与训练概况

BetterGPT-150M 是一个标准的文本补全(base completion)模型,并非经过指令微调的对话模型。开发者将训练划分为稳定阶段(stable phase)与退火阶段(annealing phase),在 FineWeb-Edu、数学相关语料、cosmopedia 以及 starcode-python 等精选数据集上进行混合训练,强调在有限 token 预算下保持能力不退化。模型参数量约 1.52 亿,定位为低内存/低显存占用,可在标准 CPU 上即时推理。

基准表现与定位

开发者声称,基准评估显示该模型优于 GPT-2 Small,并能与使用明显更大 token 预算训练的小模型持平。由于 GPT-2 已是较早一代架构,参考价值有限,文中未给出具体的 benchmark 分数或对比表格,相关结论尚需社区独立复现。

开源资源与试用入口

目前已公开的资源包括:

开发者说明与社区反馈请求

开发者表示这是其首次正式尝试训练并发布语言模型,欢迎社区在 Demo 上试玩提示词、下载权重本地运行,并就后续指令微调方向、benchmark 选择或架构改进提出建议。整体而言,这是一项典型的个人小规模实验性发布,对主流大模型生态影响有限,但对关注轻量架构与端侧推理的爱好者仍有一定参考价值。

信源