DeepSeek V4 Pro 上线 Together AI:1.6T MoE 架构、支持 1M 上下文
Together AI 在 X 平台宣布上线 DeepSeek V4 Pro 0813 版本,采用 1.6T 参数 Mo…
Together AI 在 X 平台宣布,DeepSeek 旗舰模型 V4 Pro 的 0813 版本已在该平台正式上线。这是 DeepSeek 当前主推的旗舰版本,采用 1.6T 规模的 MoE(混合专家)架构,原生支持 100 万 token 上下文窗口,并面向不同任务场景提供三种推理模式。
模型规格与架构
根据 Together AI 披露的信息,DeepSeek V4 Pro 0813 采用 1.6T 参数级别的 MoE 架构。MoE 设计意味着模型在推理时仅激活部分专家,从而在保持大参数容量优势的同时控制单次推理的计算开销。上下文窗口达到 1M token,足以容纳长文档、多轮对话或大规模代码仓库等需要长程依赖的输入场景。
三种推理模式
Together AI 介绍,V4 Pro 提供三种推理模式,分别面向不同应用方向:
- 编码(coding):面向代码生成、补全与调试等编程类任务。
- 智能体(agents):面向需要多步规划、工具调用与自主决策的智能体场景。
- 复杂推理(complex reasoning):面向数学、科学、逻辑等需要深度推理链的任务。
三种模式的区分意味着开发者可以根据任务特征切换推理路径,而不必为不同负载分别接入不同模型。
上线平台与可用性
此次发布的版本号为「0813」,已在云端推理平台 Together AI 上架,用户可通过该平台直接调用 DeepSeek V4 Pro。需要注意的是,目前公开渠道披露的技术信息仍以 Together AI 在 X 上的发布内容为主,DeepSeek 官方的完整技术报告、benchmark 数据与开放权重情况尚未在原文中给出,后续值得持续关注。
行业意义
DeepSeek 此前已凭借 V3 与 R1 系列在开源与性价比路线上获得较高关注度。本次 V4 Pro 将参数规模与上下文长度同时推高,并引入多模式推理,反映出头部模型在「更大容量 + 更长上下文 + 更细分推理路径」方向上的持续演进。1.6T MoE + 1M 上下文的组合,也使其与同期主流旗舰模型在规格层面具备直接对比的资本。
