桃子桃子快讯
返回首页
开源

DeepSeek V4.1 Flash 上线 Hugging Face:552B 参数 MoE 新架构

DeepSeek V4.1 Flash 在 Hugging Face 开放,采用 552B 参数 MoE 与编码器-解码…

2026.09.10 · 周四2 分钟阅读

DeepSeek V4.1 Flash 已在 Hugging Face 平台开放,这是该团队新架构家族中体积最小的成员。模型采用 552B 参数的 MoE(混合专家)架构,并引入了业界近年来较少见的编码器-解码器(Encoder-Decoder)结构,与目前主流的纯解码器 LLM 路线形成明显差异。

模型规格与架构

  • 总参数规模:552B,属于 MoE 架构,实际激活参数量未在原始披露中给出。
  • 架构类型:编码器-解码器,区别于当前主流的 decoder-only LLM。
  • 定位:新架构家族中最小的成员,意味着后续还可能有更大或更专精的版本发布。

原生视觉理解能力被作为该版本的关键能力之一,意味着模型在预训练阶段就内置了多模态支持,而非通过后期适配实现。

训练方法调整

V4.1 Flash 在训练流程上做了两处重要改动:

  • 预训练方法:采用新的预训练方案,原文未披露具体技术细节(例如数据配比、目标函数变化等)。
  • 后训练阶段:进行了更大规模的强化学习后训练(RL post-training),通常用于提升推理、对齐和指令遵循能力。

原文未公布具体的 RL 训练数据规模、奖励模型设计或基准测试成绩,因此训练调整带来的实际收益仍待社区复现与测评。

上线渠道与可用性

模型权重已上传至 Hugging Face,开发者可直接下载或通过兼容框架加载。考虑到 MoE 架构的部署门槛(显存、推理引擎支持),实际落地仍需相应的推理基础设施配套,例如 vLLM、SGLang 或 DeepSeek 自有推理方案。

值得关注的几个点

  • 编码器-解码器路线在 2024–2026 年的开源大模型中相对少见,若 V4.1 Flash 在长文本理解或检索类任务上表现突出,可能影响后续架构选型讨论。
  • 原生视觉理解 + RL 后训练的组合,与近期多模态推理模型的演进方向一致。
  • 作为家族中最小的版本,V4.1 Flash 的表现将为后续更大体量的模型提供基线参考。

当前披露的信息以参数规模、架构类型与训练策略为主,缺少 benchmark 跑分、对标对象和上下文窗口等关键细节,待 DeepSeek 发布更完整的技术报告或模型卡后,可对其能力边界做出更准确判断。

信源