SupraLabs 发布 50 万参数非 Transformer 实验模型
SupraLabs 发布 SupraElegans-500K,50 万参数的因果语言模型,采用无注意力机制的稀疏有符号循…
SupraLabs 在 Hugging Face 上正式开源了一个名为 SupraElegans-500K 的实验性因果语言模型,参数量约为 50 万。该模型完全放弃了 Transformer 架构,没有注意力机制,也没有位置编码与 KV 缓存,依赖持续更新的神经元膜电位来承载上下文。这是该模型的首个公开检查点,作者明确表示目标是在极小规模下验证其架构能否完成可用语言建模,而非在质量上对标 Transformer。
架构:受秀丽线虫启发的稀疏循环图
模型的整体结构可以概括为:token → embedding → 感觉神经元 → 稀疏循环图 → 输出神经元 → 词表 logits。
神经元群体与连接
模型将固定神经元池划分为感觉层、中间/关联层、输出层三个连续索引区段。神经元之间通过稀疏、有向、带正负号的边列表相连,每个神经元的扇入扇出约为 10–20。训练和推理过程中都不会实例化稠密权重矩阵,信号传播通过基于边的 scatter-add 实现。
神经元动态
每个神经元 i 在每个微步传播中执行以下更新:
- 膜电位更新:
v[t+1] = clamp(leak_i * v[t] + incoming[t] + bias_i, -6, 6) - 激活值:
a[t+1] = tanh(v[t+1] - threshold_i)
其中 leak、bias、threshold 均为每个神经元独立学习参数,incoming 为所有指向该神经元的边信号按 1/sqrt(平均扇入) 缩放后累加,以控制不同入度神经元之间的方差。
跨 token 的持续状态
每个 token 的 embedding 被投影到感觉层后,图会运行固定次数的传播微步(默认 3 步),再由输出层读出并映射到词表 logits。膜电位在整个序列处理过程中持续存在,这也是该模型「上下文窗口」的来源。生成时只需维护当前的 (v, a) 状态张量,无需 KV cache。
训练方式
- 目标函数:标准的 next-token 预测(交叉熵)
- 优化方式:对固定长度片段做截断 BPTT,片段之间将状态 detach(不重置)
- tokenizer:从头训练的字节级 BPE,词表刻意保持较小
- 拓扑结构:初始化时按固定随机种子生成一次稀疏图,不参与学习
- 数值稳定性:入信号按
1/sqrt(avg fan-in)缩放,膜电位夹在[-6, 6]
基准表现
模型在常见基准上的成绩如下,远低于同参数规模的 Transformer:
- HellaSwag:26.5%
- ARC-Easy:21.0%
- ARC-Challenge:22.0%
- WinoGrande:52.0%
局限与许可
SupraLabs 明确列出了多项限制:
- 小 token 预算与小模型,不期望具备长程一致性、事实可靠性或提示鲁棒性
- 没有进行安全或指令微调,输出应视为原始 LM 续写
- 拓扑是固定的随机稀疏图,不参与学习或进化
- 暂未发布匹配参数量的 Transformer 基线对比
模型以 Apache 2.0 协议开源,仓库路径为 SupraLabs/SupraElegans-500k。整体而言,这是一个面向架构探索的小型实验性检查点,而非面向生产使用的语言模型。
