桃子桃子快讯
返回首页
开源

Fractale-350M-base 开源:把记忆训练成行为

独立研究者发布 3.86 亿参数基座模型,用 8 个 gist 向量充当长期记忆,全程开源且可复现。

2026.07.20 · 周一4 分钟阅读

核心思路:把记忆放进前向计算

Fractale-350M-base 是独立研究者 KKuettes 公开的预训练基座模型,参数规模 3.86 亿,在 10B token(代码 + 英文网页)上从零训练。它没有传统意义上的「长上下文」:模型的全部长期记忆是一组由 8 个向量组成的 bank,每个向量对应一段 512 token 切片的概要,最旧条目按 FIFO 淘汰。

与常见的检索或对历史文本做注意力不同,这些向量会作为「快权重」(fast weights)参与前向计算——每个槽位经过一个小型超网络(hypernet)展开为低秩 MLP,token 流从其中穿过。记忆不是被「查」出来的,而是模型自身计算图的一部分。

刻意缩小的上下文

上下文窗口被刻意压到 512 token。每个 512 token 片段是一个独立的前向过程,超出当前片段的任何信息只能经由这 8 个向量抵达下一段预测。预训练目标也据此设计:仅凭 bank 状态(输入留空)预测下一篇文档开头,迫使 bank 成为关键信息通道。

可量化的 GAP

研究者在留出文档上比较「携带 bank」与「重置 bank」两种条件下的交叉熵,用差值 GAP 衡量记忆贡献:

  • 代码语料:CE 从 12.9(重置)降至 3.45(携带),GAP +9.4 nats
  • 英文网页语料:GAP +7.3 nats
  • 该差距在写入 2 至 8 个 chunk 之间保持平稳,未出现 FIFO 淘汰断崖

训练过程中两条分支的趋势更值得关注:仅凭 bank 预测的一路损失持续下降,而关闭 bank 的一路反而退化,说明模型在预训练中越来越依赖这套记忆。小规模机制实验还显示:内容可由线索寻址、在 2000+ 步后仍存留,并能在文档与代码之间双向迁移;论文中一个 13 token 呈现即可在未见查询上达到 0.79–1.00 准确率(DOI 已发布于 Zenodo)。

明确边界

作者强调几条限制,避免被高估:

  • 这是 base 模型,没有指令微调与对齐,3.86 亿参数 / 10B token 规模下原始流畅度有限
  • bank 保存的是「概要」(领域、语域、结构、声明过的事实),不是原文逐字记录,无法逐行引用
  • GAP 对照的是「模型自身去掉记忆」,并非同算力下的注意力基线,匹配基线实验尚在进行

全部开源与可复现

  • 权重与模型卡(含训练配比、一次 NaN 事故记录):Hugging Face fractale-lm/Fractale-350M-base
  • 使用工具包(推理方式与经典 LM 不同,需手动携带 bank 状态):GitHub fractale-lm/fractale
  • 研究仓库(训练代码、探针实验、完整研究日志):GitHub kkuette/thought-bank
  • Phase 1 全量复现脚本(8 卡 A100,固定 commit):仓库 repro/phase1 目录

整次预训练成本约 320 美元的 8xA100 租用算力,全部由研究者自费。仓库还附带从固定 commit 复现整个预训练的脚本。

下一步计划

作者正推进 Phase 2 的探索性工作:先做指令微调,让「记住」成为一种可被主动调用的行为,再以 bank 作为工作记忆进行强化学习。研究者欢迎社区在 GitHub 与 Reddit 上反馈「哪里会出错」,以便继续打磨这套小而专的记忆机制。

信源