桃子桃子快讯
返回首页
研究论文

mini-AGI:可在笔记本上训练的循环 Transformer 实验

开发者发布实验项目 mini-AGI,结合循环 Transformer、MoE、SSD 分页权重与进化式扩容,号称可在笔…

2026.09.23 · 周三2 分钟阅读

一名独立开发者在 Reddit 的 r/LocalLLaMA 板块发布了一个名为 mini-AGI 的实验项目,主打「在普通笔记本上即可持续学习并自我扩容」的循环 Transformer 架构。由于目前没有论文、也没有公开的 benchmark 数据,该项目仍属于个人探索性质,但其设计思路在社区内引发了一定讨论。

架构核心:循环 Transformer + 动态 MoE

mini-AGI 并非传统的固定层数 Transformer,而是一个「按需循环」的动态结构:

  • 单个 token 的推理深度最高可达 24 个循环周期,由模型动态决定。
  • 内置混合专家(MoE)系统:8 个专家始终激活,32 个驻留在显存中等待路由,另外 96 个专家以缓存形式存在。
  • 权重不全部常驻显存:主权重放在 SSD 上,按需分页加载到显存,类似操作系统虚拟内存的设计。
  • 没有传统分词器(tokenizer),模型直接以原始字节(raw bytes)作为输入。

持续学习与「进化式扩容」

项目另一大卖点是模拟 AGI 风格的持续学习能力:

  • 采用自监督方式不断摄入新数据进行训练,无需人工标注。
  • 模型会按需生成新专家(expert)并增加参数量,表现不佳的专家则被剪枝淘汰,呈现「进化式增长」。
  • 通过慢速主干 + 快速专家的双学习率机制,缓解持续学习中常见的灾难性遗忘问题。

性能预期与社区质疑

开发者声称训练曲线目前保持「15 倍增长」的趋势,目标是达到 GPT-2 级别的能力水平,并预计「几周后」在达到该目标时开源权重。但其本人也承认这只是基于趋势线的粗略估计,未来可能「出现拐点」。截至目前,项目没有发布:

  • 与主流模型的 benchmark 对比数据;
  • 可复现的训练代码或论文;
  • 显存占用、推理速度等实测指标。

社区对此反应分化:一部分人认为把 SSD 分页、循环深度与 MoE 整合到笔记本可跑的程度非常有意思;另一部分人则指出,在没有 benchmark 的情况下「GPT-2 水平」的声明难以验证,且字节级输入+极深循环的组合在工程上是否能稳定训练仍存疑。整体来看,mini-AGI 更像是一份值得关注的架构提案,而非已经成熟的开源项目。

信源