研究论文
mini-AGI:可在笔记本上训练的循环 Transformer 实验
开发者发布实验项目 mini-AGI,结合循环 Transformer、MoE、SSD 分页权重与进化式扩容,号称可在笔…
2026.09.23 · 周三约 2 分钟阅读
一名独立开发者在 Reddit 的 r/LocalLLaMA 板块发布了一个名为 mini-AGI 的实验项目,主打「在普通笔记本上即可持续学习并自我扩容」的循环 Transformer 架构。由于目前没有论文、也没有公开的 benchmark 数据,该项目仍属于个人探索性质,但其设计思路在社区内引发了一定讨论。
架构核心:循环 Transformer + 动态 MoE
mini-AGI 并非传统的固定层数 Transformer,而是一个「按需循环」的动态结构:
- 单个 token 的推理深度最高可达 24 个循环周期,由模型动态决定。
- 内置混合专家(MoE)系统:8 个专家始终激活,32 个驻留在显存中等待路由,另外 96 个专家以缓存形式存在。
- 权重不全部常驻显存:主权重放在 SSD 上,按需分页加载到显存,类似操作系统虚拟内存的设计。
- 没有传统分词器(tokenizer),模型直接以原始字节(raw bytes)作为输入。
持续学习与「进化式扩容」
项目另一大卖点是模拟 AGI 风格的持续学习能力:
- 采用自监督方式不断摄入新数据进行训练,无需人工标注。
- 模型会按需生成新专家(expert)并增加参数量,表现不佳的专家则被剪枝淘汰,呈现「进化式增长」。
- 通过慢速主干 + 快速专家的双学习率机制,缓解持续学习中常见的灾难性遗忘问题。
性能预期与社区质疑
开发者声称训练曲线目前保持「15 倍增长」的趋势,目标是达到 GPT-2 级别的能力水平,并预计「几周后」在达到该目标时开源权重。但其本人也承认这只是基于趋势线的粗略估计,未来可能「出现拐点」。截至目前,项目没有发布:
- 与主流模型的 benchmark 对比数据;
- 可复现的训练代码或论文;
- 显存占用、推理速度等实测指标。
社区对此反应分化:一部分人认为把 SSD 分页、循环深度与 MoE 整合到笔记本可跑的程度非常有意思;另一部分人则指出,在没有 benchmark 的情况下「GPT-2 水平」的声明难以验证,且字节级输入+极深循环的组合在工程上是否能稳定训练仍存疑。整体来看,mini-AGI 更像是一份值得关注的架构提案,而非已经成熟的开源项目。
