inclusionAI 发布 LLaDA2.2-flash:引入 Levenshtein 编辑的扩散语言模型
LLaDA2.2-flash 是 100B 参数 MoE 扩散语言模型,上下文扩至 128K,引入 DELETE/INS…
inclusionAI 在 Hugging Face 平台开源了 LLaDA2.2-flash 模型,这是 LLaDA2 系列中首个面向智能体(agent)应用的扩散语言模型。该模型在扩散语言建模基础上引入 Levenshtein 编辑机制,通过 DELETE 与 INSERT 两个控制 token 实现并行生成过程中的序列编辑,被官方称为 LLaDA2 系列从纯生成能力向「智能体应用」延伸的第一步。
模型概览
LLaDA2.2-flash 定位为混合专家(Mixture-of-Experts, MoE)扩散语言模型,关键规格如下:
- 类型:MoE 扩散语言模型,集成 Levenshtein 编辑能力
- 总参数(非 Embedding):100B
- 层数:32
- 注意力头数:32
- 位置编码:旋转位置编码(RoPE)
- 词表大小:157,184
- 上下文长度:128K token
- Levenshtein 控制 token:DELETE、INSERT
核心创新:Levenshtein 编辑
传统自回归语言模型按 token 顺序逐个生成,扩散语言模型则采用并行去噪方式生成序列。LLaDA2.2-flash 在扩散解码过程中引入 Levenshtein 编辑机制,允许模型在并行生成的同时执行两类操作:
- DELETE:删除冗余内容;
- INSERT:在已有序列中创建插入位置,增加新内容。
借助这两个控制 token,模型可以动态调整生成序列的结构,而非一次性产出整段文本。该机制为后续多轮工具调用、错误修正等智能体场景提供了序列层面的可编辑能力。
128K 长上下文与 MoE 架构
为支撑长上下文智能体工作负载,LLaDA2.2-flash 将上下文长度扩展至 128K token,并提出 Block Routing:在扩散 Block 级别对 MoE 专家激活进行约束,从而控制计算量在长上下文下的增长。该设计的目标是在保持 100B 规模参数容量的同时,让 MoE 能够高效处理超长输入,是其面向智能体场景的基础设施级优化。
面向智能体的强化学习:L-EBPO
针对多轮工具调用中的错误修正需求,LLaDA2.2-flash 提出了 Levenshtein Editing ELBO-based Block-level Policy Optimization(L-EBPO)。该方法基于 Levenshtein 编辑的证据下界(ELBO)进行块级策略优化,结合智能体环境奖励,对 Levenshtein 编辑行为与错误修正过程进行强化学习训练,从而让模型在多轮交互中具备自我纠错能力。
官方在模型卡中提示,详细的训练流程与实验结果可参阅其技术报告。LLaDA2.2-flash 的开源为社区研究扩散语言模型在智能体、长上下文、并行编辑等方向的应用提供了一个新基座。
