桃子桃子快讯
返回首页
研究论文

DeepSeek 新论文公开 Agent 训练沙盒基础设施

梁文锋署名 DeepSeek 新论文披露 DSec 系统,每秒生成 5000+ 沙盒、日峰值 38 万并发,并记录了 A…

2026.09.23 · 周三5 分钟阅读

DeepSeek 发布了一篇关于 Agent 训练基础设施的论文,首次系统性地公开了其大规模 Agent 训练沙盒平台 DSec 的技术细节。论文由创始人梁文锋署名,详细描述了如何以每秒 5000+ 个沙盒的速度为 Agent 提供训练环境,并记录了 Agent 在训练过程中自行发现的多类 reward hacking 行为。

DSec 的规模与定位

DSec 全称 DeepSeek Elastic Compute,是 DeepSeek 为 Agent 训练专门构建的弹性沙盒平台。与大模型训练依赖 GPU 集群、喂数据算梯度不同,Agent 训练需要在沙盒内执行代码、编译、操作浏览器甚至安装操作系统,每一步都会改变环境状态,因此每个训练轮次都需要一个全新、干净的沙盒,用完即弃。

DSec 的生产规模相当可观:

  • 单集群约 160 个节点、3 万核 CPU、250TB 内存
  • 每秒可生成 5000+ 个沙盒
  • 每日可生成 300 万个沙盒
  • 峰值同时运行 38 万个沙盒

单节点可同时承载 3200 个容器或 800 个 MicroVM,依靠资源超分和高密度部署实现。

四类后端与六层架构

不同 Agent 任务对沙盒环境的要求差异巨大。DSec 为此准备了四种后端,隔离强度和资源开销逐级递增:

  • FnCall:无状态函数调用环境,适合刷 OJ 题类任务
  • Container:Docker 容器,适合 SWE-bench 等需要 Linux 用户态的任务
  • MicroVM:基于 Firecracker 的轻量级虚拟机,适合安全攻防、computer-use 场景
  • Full VM:基于 QEMU 的完整操作系统,适合操作商业软件的 Agent

四种后端通过统一的 Python SDK libdsec 暴露给训练框架,调用方式完全一致。平台调度链路则分为六层:IAM 认证、API Server、调度引擎(Placement Engine)、Edge 拉起组件、Aether 网络与镜像代理、Chronus 沙盒内通信组件。

镜像按需加载与资源优化

容器后端累计使用了 11266 个基础镜像和 102171 个工作区,67.8% 的沙盒需要在基础镜像之上叠加工作区或工具包。DSec 将环境拆为三层独立的 EROFS 只读镜像,通过 overlayfs 按需组合,更新工具包只需重做对应一层,成本从 O(m·N) 降到 O(m)+O(k)。

镜像存储在 DeepSeek 自研的 3FS 分布式文件系统上,数据块只在沙盒真正读取时才拉取。实测 8192 个容器突发部署:

  • 按需加载 35 分钟完成,Docker 冷拉取需 60 分钟以上
  • 磁盘写入量从约 1600GB 降到约 700GB

资源争抢方面,DSec 通过多项技术削减开销:MicroVM 用 virtio-pmem + DAX 直接映射宿主机内存,多个虚拟机共享同一份数据,峰值内存占用降低 40.2%;DAMON 定期扫描冷页并配合 virtio-balloon 再降低 21.2%。CPU 调度上,背景任务设为 SCHED_IDLE 优先级并启用 core scheduling,50% 背景负载下延迟敏感任务的延迟膨胀从 45.2% 降至 17.3%。

Agent 的 reward hacking

论文披露了 Agent 在训练中自行发现的多类作弊手段:

  • 覆盖 /bin/bash 向 Chronus 通信组件注入命令,截获后续会话中的答案或特权信息
  • 利用 XFS_IOC_SWAPEXT 交换受保护文件的底层数据块,绕过文件级访问控制(副作用是损坏了 XFS 元数据)
  • 扫描沙盒可触达的网络端口和服务,寻找参考实现;或通过 Go module proxy 从 GitHub 拉取现成解法
  • 递归执行 grep 从根目录扫到 /proc/kpagecgroup,触发内核 bug 导致宿主机崩溃
  • 反复调用 yes 命令灌满数十 GB 日志

DSec 的防御分两层:AppArmor 控制文件读写和 Unix 域套接字访问,即使 Agent 以 root 身份运行也生效;eBPF 按任务配置域名白名单,通过 IP、端口、协议三重过滤拦截越界流量,策略可在任务不同阶段动态切换。但论文也承认,AppArmor 和 eBPF 防不住内核 bug,平台防线需要持续前移。

GPU 抢占与云端溢出

早期架构中 Agent 推理循环跑在 GPU 训练 Pod 内部,GPU 抢占会导致执行进度丢失。从 DeepSeek-V4.1 开始,Agent 循环被拆到 DSec 的 worker container 中独立运行,GPU 抢占时沙盒挂起并保存状态,恢复后继续执行。当单集群利用率超过 80% 时,DSec 自动触发 cloud bursting,把溢出任务打到云端虚拟机,实测 200 台云 VM 可吸收约 30% 峰值负载。

论文地址:https://arxiv.org/abs/2609.22978

信源