开源
DeepSeek V4.1 Flash 上线 Hugging Face:552B 参数 MoE 新架构
DeepSeek V4.1 Flash 在 Hugging Face 开放,采用 552B 参数 MoE 与编码器-解码…
2026.09.10 · 周四约 2 分钟阅读
DeepSeek V4.1 Flash 已在 Hugging Face 平台开放,这是该团队新架构家族中体积最小的成员。模型采用 552B 参数的 MoE(混合专家)架构,并引入了业界近年来较少见的编码器-解码器(Encoder-Decoder)结构,与目前主流的纯解码器 LLM 路线形成明显差异。
模型规格与架构
- 总参数规模:552B,属于 MoE 架构,实际激活参数量未在原始披露中给出。
- 架构类型:编码器-解码器,区别于当前主流的 decoder-only LLM。
- 定位:新架构家族中最小的成员,意味着后续还可能有更大或更专精的版本发布。
原生视觉理解能力被作为该版本的关键能力之一,意味着模型在预训练阶段就内置了多模态支持,而非通过后期适配实现。
训练方法调整
V4.1 Flash 在训练流程上做了两处重要改动:
- 预训练方法:采用新的预训练方案,原文未披露具体技术细节(例如数据配比、目标函数变化等)。
- 后训练阶段:进行了更大规模的强化学习后训练(RL post-training),通常用于提升推理、对齐和指令遵循能力。
原文未公布具体的 RL 训练数据规模、奖励模型设计或基准测试成绩,因此训练调整带来的实际收益仍待社区复现与测评。
上线渠道与可用性
模型权重已上传至 Hugging Face,开发者可直接下载或通过兼容框架加载。考虑到 MoE 架构的部署门槛(显存、推理引擎支持),实际落地仍需相应的推理基础设施配套,例如 vLLM、SGLang 或 DeepSeek 自有推理方案。
值得关注的几个点
- 编码器-解码器路线在 2024–2026 年的开源大模型中相对少见,若 V4.1 Flash 在长文本理解或检索类任务上表现突出,可能影响后续架构选型讨论。
- 原生视觉理解 + RL 后训练的组合,与近期多模态推理模型的演进方向一致。
- 作为家族中最小的版本,V4.1 Flash 的表现将为后续更大体量的模型提供基线参考。
当前披露的信息以参数规模、架构类型与训练策略为主,缺少 benchmark 跑分、对标对象和上下文窗口等关键细节,待 DeepSeek 发布更完整的技术报告或模型卡后,可对其能力边界做出更准确判断。
