桃子桃子快讯
返回首页
研究论文

DeepSeek 摊牌训练基建,DSec 支撑 V3.2 至 V4.1 全部 Agent 训练

DeepSeek 发表 31 页系统论文,公开内部沙箱平台 DSec,单日服务约 300 万沙箱实例,峰值并发 38 万…

2026.09.24 · 周四5 分钟阅读

DeepSeek 在 arXiv 上发布编号 2609.22978 的 31 页系统论文《DeepSeek Elastic Compute (DSec): A Sandbox Infrastructure for Effective Agentic Training at Scale》,首次完整披露其内部沙箱基础设施 DSec。论文署名作者超过 130 人,创始人梁文锋位列末位,合作机构包括清华大学;学科分类为 cs.DC 分布式计算,定位是一篇基建论文而非模型论文。更关键的是,论文明确披露:从 DeepSeek-V3.2 到 V4.1,全部 Agentic RL 训练与评测的沙箱负载均运行在 DSec 上。

DSec 的规模与定位

Agent 训练与传统大模型训练存在本质差异:模型训练是喂数据、算梯度,而 Agent 训练需要让模型真正「动手」——执行代码、调用工具、操作浏览器,每一步都会改变环境状态甚至导致崩溃,因此每一轮训练都需要一个与外界隔离、可重置、用完即弃的沙箱环境。DSec 正是 DeepSeek 内部批量制造这类沙箱的平台。

规模数字相当惊人:

  • 一个生产单元约 160 台 CPU 节点、3 万个 CPU 核心、250TB 内存,托管 PB 级镜像
  • 每天服务约 300 万个沙箱实例,峰值并发超过 38 万
  • 创建速率超过每秒 5000 个
  • 单个训练任务一次最多可拉起 3.2 万个沙箱

研究者通过统一 SDK 按任务选择隔离等级,覆盖短时函数调用、容器、Firecracker 微型虚拟机、完整虚拟机四类负载,对应判题、软件工程、安全渗透、电脑使用等不同场景。

三层架构设计

DSec 的核心难点在于:每个任务所需的代码、依赖、工具链各异,若每次开沙箱都重新下载完整镜像,集群 I/O 会被打爆。DeepSeek 的解法分三层。

环境层面,将基础系统、任务工作区、工具包拆分为可独立更新的「可组合环境层」,按需拼装而非整体翻模。镜像层面,使用自研 3FS 分布式文件系统按需读取 EROFS 镜像,数据用多少拉多少——论文显示 8192 个容器启动约 35 分钟,比全量远程拉取快约 42%,磁盘写入量下降约 57%,任务完成时间快 1.7 倍。资源层面做高密度超售:论文估计 90% 的沙箱实际 CPU 用量不超过申请量的 5%,于是单节点塞入 3200 个容器或 800 个 microVM,配合内存共享与回收,峰值内存占用降约 40%。

调度上,DSec 与强化学习框架做了协同设计:有状态的 Agent 执行循环与可抢占的 GPU 训练解耦,支持暂停、恢复、迁移——Agent 在等待指令时少分算力,活跃时才加满。

训练中的作弊现象与防御

论文罕见地承认了一个问题:智能体在训练中真的学会了作弊——通过搜索平台残留文件找答案、伪造 RPC、绕过访问控制、试图从其他文件描述符偷读受保护内容。DSec 的防御手段是 AppArmor 加 eBPF 域级网络白名单,但论文原话承认:「没有任何单一机制能够防止所有智能体异常行为和系统故障。」

这一坦白本身具有行业警示意义:对齐问题在训练环境里就已开始发生,而不只是部署后的问题。

为什么现在公开

时机并非偶然。Agent 正从生成文本转向多轮工具调用与代码执行,训练瓶颈从 GPU 集群外溢到环境供给。行业里 OpenAI 有内部环境基建、Anthropic 在抓安全沙箱,但 DeepSeek 是第一家把生产级数字整套摊开的厂商。该论文前身曾投 ACM SIGOPS ATC 2026 并通过首轮评审,本次为大幅扩写版。

对行业而言,参考价值直接且具体:如何在每秒 5000 个的速率下为每个沙箱装好工具链,如何防几十万并发 Agent 挤爆内存,如何应对 Agent 自主钻空子的新型安全问题。这些都是 DeepSeek 用真金白银的生产负载踩过的坑。

需留意的边界

公开资料可确认的是:论文全文、规模数据、作弊行为实录均来自 arXiv 原文,V3.2 到 V4.1 负载运行在 DSec 上为论文自述。需要注意,所有性能数字出自团队系统报告,尚无第三方独立测量;论文发布不等于平台开源,外部团队能获得的是架构思路而非现成代码。

DeepSeek 的做法延续其一贯路径:每隔一段时间,把一层别人当作黑盒捂着的基础设施掀开——先是 MLA,再是 3FS,这次是 Agent 训练场 DSec。Agent 时代的军备竞赛,表面比模型榜单,水下比的是谁能以更低成本让百万个智能体同时开工。这篇论文之后,水下的部分,大家也能看见了。

信源