桃子桃子快讯
返回首页
开源

开发者从零训练 250M 极小 LLM:2 位量化、60MB 体积、纯 CPU 400 tok/s

一名开发者发布 SHADOW-250M:从零训练、30B tokens、2 位量化、60MB 部署,支持 1 亿 tok…

2026.08.22 · 周六4 分钟阅读

一名独立开发者近日在 Reddit r/MachineLearning 发布了一套名为 SHADOW-250M 的小模型方案:从零训练 250M 参数,在 FineWeb 的 30B tokens 上完成预训练,并通过激进的 2 位以下量化将整模型压缩至 60 MB,可在普通笔记本 CPU 上以约 400 tok/s 的速度运行,无需 GPU。项目代码、权重与可复现脚本已同步开源至 GitHub 与 Hugging Face。

模型规模与部署体积

SHADOW-250M 参数量仅 250M,量化后整模型体积约 60 MB,运行时内存占用约 80 MB。开发者明确表示,该模型定位并非在通用能力上对标主流大模型,而是验证极小参数量化模型在低成本硬件上的可用性。在开放域事实问答等任务上,模型仍会出现错误。

  • 参数量:250M
  • 训练数据:FineWeb 子集,30B tokens
  • 量化精度:< 2 bit
  • 部署体积:约 60 MB
  • 运行内存:约 80 MB
  • CPU 推理速度:约 400 tok/s

磁盘长上下文机制

为突破小模型通常受限于短窗口的问题,方案引入了一套磁盘级 KV 缓存机制:

  • 最近 2048 个 token 以 fp16 形式常驻内存,作为标准 KV 缓存。
  • 更早的 token 被压缩为 1 bit 后写入磁盘,每 token 约 320 字节。
  • 模型在训练阶段即学会从该磁盘缓存中检索信息,理论支持最长 1 亿 token 的历史上下文。
  • 受限于训练预算,模型目前仅被训练为「检索并回答」,而非对检索内容进行多步推理。

按上述压缩比计算,1M token 的历史约占用 320 MB 磁盘空间。

词表与基础质量评测

SHADOW-250M 采用了与传统可训练 embedding 表不同的词表方案:每个 token 对应一个固定的 512 位编码,全部 131k token 仅占 8.4 MB,且不包含任何可训练参数。开发者在 WordSim-353 人类词义相似度基准上测试了该编码表,得到 Spearman 相关性 0.619,远高于随机编码的 0.029。

基础语言建模质量在训练未见的英文教育类网页(2048 token 窗口)上评估:

  • 交叉熵:3.15 nats/token
  • 困惑度(perplexity):23.3
  • 比特率:0.99 bits/byte

示例输出与可复现性

原帖附带了若干生成示例与对应采样设置,便于他人复现。例如在 50.6M token 深度的归档中检索设备序列号时,模型返回了与目标编号对应的「SN-442976」。仓库同时附带用于微调的 master 权重与微调前后对比数据,开发者表示「设置已全部公开,不存在 cherry-picking」。

  • 推理输入:「Explain photosynthesis in two sentences.」(贪心解码) 输出:给出了光合作用的标准两句解释。

  • 推理输入:「Write a short poem about the sea.」(temp 0.25, top-k 30, rep 1.15, seed 2) 输出:生成了一段围绕海浪、风、笑容意象的散文式文本。

整体而言,SHADOW-250M 更像是一项面向极低资源部署与磁盘级长上下文检索的工程实验,而非通用大模型的竞争者。对关注模型压缩、边缘部署与长上下文外推的研究者与开发者而言,其公开的代码与数据可作为参考样本。

信源