开源
开发者以 250 美元预训练 10 亿参数 Kimi K3 迷你复刻
开发者基于 Kimi K3 架构预训练 10 亿参数模型,仅用 5 亿 token 训练数据与 250 美元成本,Hel…
2026.08.20 · 周四约 2 分钟阅读
一名开发者近日在 Reddit r/LocalLLaMA 板块发布了一项个人预训练成果:在不到 250 美元的成本下,基于月之暗面 Kimi K3 报告的架构,从零训练出一个 10.2 亿参数的迷你复刻模型。该模型仅做过了「预测下一个 token」这一件事,没有经过指令微调,却已在 HellaSwag 基准上拿到 33.4%,超过了 GPT-2 124M 的 28%。
模型基本规格
这版「mini K3」具体参数如下:
- 总参数 1.02 B,每个 token 激活参数 145 M(典型的 MoE 架构配置)。
- 训练数据量 5,000,003,584 token,相较前沿模型动辄数万亿 token 的语料规模,属于「零头中的零头」。
- 使用 Kimi K3 原生 163,840 token 词汇表,未做任何修改。
- 未做指令微调、未做对齐,仅完成预训练阶段。
复刻的 K3 架构要素
作者声称完整复刻了 K3 的若干核心架构设计:
- Kimi Delta Attention、Gated MLA(门控多头潜在注意力)以及 Attention Residuals;
- LatentMoE,并沿用了 K3 报告中的「aux-loss-free」负载均衡策略;
- 保持 K3 的激活函数及其两个常数不变。
这些信息对想研究 K3 架构细节但无法直接获取官方权重的社区研究者具有一定参考价值。
成绩与意义
在 HellaSwag 基准上,模型取得 33.4% 的成绩,超越了 OpenAI 在 2019 年发布的 GPT-2 124M 版本(28%)。作者同时指出:
- 与 K3 原始尺寸相比,这版模型仅为后者的约两千分之一;
- 训练成本不到 250 美元,证明在极小预算下完成一次端到端预训练是可行的;
- 整个训练过程以教学目的为主,更像是一次「可行性验证」而非性能竞赛。
局限与说明
需要注意的是,这是个人项目的自报结果,缺乏独立复现验证,且训练规模与主流大模型相距甚远。作者将完整流程整理成了付费教程发布在 Vizuara 平台,读者若想自行复刻可参考其中步骤。整体而言,这项工作更适合被视作「Kimi K3 架构公开后的一次社区探索」,而非可与一线大模型对标的发布。
