BananaMind-2-Pro 开源:1.39 亿参数,消费级 GPU 训练 20 天
BananaMind 团队发布 1.39 亿参数基础语言模型 BananaMind-2-Pro,在消费级 GPU 上完成…
BananaMind 团队发布了一款名为 BananaMind-2-Pro 的基础语言模型,仅有 138,971,520 个参数(约 1.39 亿),从零开始在一张消费级 GPU 上完成 100B token 预训练,全程历时 20 天。该项目以 Hugging Face 仓库形式开源权重(safetensors 格式),并明确说明其为「base model」,未经过指令微调,需要以续写(continuation)方式使用。
训练概况
BananaMind-2-Pro 的预训练计划为 100B token,最终实际处理了 99,999,449,088 token,分 184,954 个优化器步完成,对应 checkpoint step 为 184,953。整个训练被划分为多个阶段,最终阶段为「quality finish」,训练与评估均已完结。项目并未单独披露具体的 GPU 型号与显存规格,仅强调整套训练在一块消费级显卡上完成。
模型架构
该模型为标准的 decoder-only Transformer,主要参数如下:
- 层数:24
- 隐藏维度:640
- 中间维度:1,920
- 注意力头:8 个 query head 共享 4 个 KV head(grouped-query attention)
- head dimension:80
- 位置编码:RoPE,θ = 100,000
- 归一化:RMSNorm(ε = 1e-6)
- MLP:SwiGLU
- 输入/输出 embedding:共享(tied)
- 上下文长度:3,072 token
架构中加入了 QK normalization 以稳定注意力 logits,并在自回归生成时启用 KV cache 以复用前缀键值。BPE tokenizer 为项目自研,词表大小 32,768,采用 byte-level 编码、NFKC 归一化,以及「digit-aware」预分词——在 BPE 之前先隔离数字,避免大整数被合并成单个 token。tokenizer 在 75 GiB 来自 FineWeb-Edu、DCLM、Cosmopedia-v2、FineMath-4+、NPSet-2 的教育类数据上训练。
评估表现
项目方在常见公开基准上自评了最终 checkpoint(batch size 32、bfloat16、CUDA),主要数字如下:
- ARC Easy:53.58%
- ARC Challenge:27.82%
- PIQA:67.52%
- HellaSwag:42.78%
- ArithMark 3(长度归一化):38.20%
- ArithMark 2:32.08%
- INT Index:24.96
- Code Elo(Base Bench 1.1 代码补全子类):1407
- Base Bench 1.1 Elo(350 题全集):1124
在 41 个 checkpoint 上做的 Base Bench 1.1 完整评估显示,从 2.70B token 到 99.999B token,模型 Elo 从较低水平逐步上升到最终 batch-1 端点的 1132 Elo(236/350 正确,67.43%,加权准确率 64.69%)。Base Bench 1.1 各类别成绩中,语言补全(Language completion)达到 1570 Elo(50/50,100%),代码补全 1407 Elo(42/50,84%),常识推理 1185 Elo,世界知识 1168 Elo,逻辑推理 1059 Elo,量化推理 886 Elo,上下文追踪 938 Elo。
与同类模型的对比
项目按 6 × 参数 × token 的近似公式估算训练算力,BananaMind-2-Pro 约为 83,382.91 PFLOPs,对应 INT Index 24.96;其 Preview 版本(约 51.9B token)算力约为 43,279.49 PFLOPs,INT Index 23.04。同等量级对比中:
- GPT-X2.5-135M(135M 参数 / 75B token / 2,048 context):60,750 PFLOPs,INT Index 25.17
- GPT-X2-125M:56,286.75 PFLOPs,INT Index 23.36
- GPT-X-125M:11,210.56 PFLOPs,INT Index 19.94
- Supra2-100M:18,000 PFLOPs,INT Index 19.41
- BananaMind-2-Medium(49.6M 参数):14,867.33 PFLOPs,INT Index 15.37
- OPT-125M:135,000 PFLOPs,INT Index 13.80
从 INT Index 看,BananaMind-2-Pro 在相近算力区间内优于 GPT-X2 与 GPT-X,但略低于 GPT-X2.5-135M;与算力远高于自己的 SmolLM-135M(484,254 PFLOPs,INT 25.74)相比仍有差距。项目方也指出,所有基准均为自评,结果可能因评测框架版本、tokenizer 处理、dtype 与评分配置而波动。
使用说明
BananaMind-2-Pro 仅是基础模型,未做指令微调或对话对齐,README 建议以续写形式使用,并通过 trust_remote_code=True 加载仓库。若需要聊天或助手能力,需要在此基础上自行进行 SFT 或后续微调。
