DeepSeek发布Agent训练专用沙盒平台DSec

DeepSeek于2026年9月公开发布论文《DeepSeek Elastic Compute (DSec): A Sandbox Infrastructure for Effective Agentic Training at Scale》(arXiv:2609.22978),并正式开源其 Agent 训练专用的沙盒基础设施系统 DSec。这是业界首个将大规模沙盒弹性调度、状态持久化与 RL 训练深度协同的生产级平台。
核心硬信息如下:
- 发布时间:2026年9月(论文公开日期)
- 系统名称:DeepSeek Elastic Compute (DSec)
- 沙盒生成能力:峰值每秒 5,000+,日均 300 万个
- 并发支持能力:380,000+ 并发沙盒
- 单集群规模:约 160 个节点、30,000 核 CPU、250TB 内存
- 存储系统:基于 Fire-Flyer File System (3FS) 的集群-wide 分布式文件系统
沙盒平台的架构设计突破
DSec 的核心价值在于解决了 Agent 高频、异构、有状态训练场景下的基础设施瓶颈。传统大模型训练依赖 GPU 集群进行批处理计算,而 Agent 训练要求模型在隔离环境中执行代码、编译项目、调用浏览器、连接服务——这些操作不仅计算密集,更需要——FnCall、容器、微虚拟机(microVM)、完整虚拟机(full-VM)四种隔离级别沙盒后端,通过统一 SDK 对外暴露。这种分层抽象使系统可针对任务需求动态选择隔离强度与性能权衡。
平台支持可独立版本控制的分层环境组合,避免重复构建镜像。为提升高密度部署下的内存效率,DSec 采用联合内存共享与回收机制;CPU 调度策略则通过过量提交(overcommit)策略实现高资源利用率,同时保障延迟敏感任务的性能。
值得注意的反差在于:Agent 训练并非单纯依赖算力,而是环境供给能力成为新瓶颈。论文指出,现有沙盒运行时难以应对突发式大规模创建、跨任务状态保留与镜像分发延迟问题,因而必须重构为弹性的执行平台而非单一运行时——这颠覆了传统训练基础设施的认知范式。
DSec 与强化学习(RL)框架深度协同:支持沙盒生命周期与训练轮次对齐,在模型训练期间保留 Rollout 状态,训练空闲时回收资源;同时内置应对手误行为(如 Reward Hacking)的治理机制,保障训练过程稳定性。
与主流方案的关键差异
| 维度 | 传统容器平台 | DSec | 备注 |
|---|---|---|---|
| 沙盒生命周期管理 | 单次执行或短时任务 | 与 RL 训练轮次绑定 | 支持状态保留与资源回收 |
| 隔离策略 | 单一容器隔离 | 四层(FnCall/容器/microVM/full-VM)动态选择 | 按任务需求匹配安全与性能 |
| 镜像分发 | 本地拉取或预热 | 按需从 3FS 加载 | 避免全量镜像 redundantly 传输 |
| 内存管理 | 进程级隔离 | 联合共享与回收机制 | 支持高密度部署 비용성 |
| 资源调度 | 静态分配 | 过量提交 + 延迟敏感保障 | 高利用率与低延迟并存 |
注: tables 直接源于论文技术描述,未添加额外参数。
实践落地建议
- 适合立即采用者:开展大模型智能体(Agent)训练的实验室或企业团队,尤其需要支持多学科任务(代码生成、工具调用、网页交互)的 RL 研究组;已有分布式计算集群经验且希望复用基础设施的组织。
- 建议再等等者:追求开箱即用方案的中小团队——DSec 当前定位为生产级基础设施而非轻量级服务,需要自行部署 160 节点集群规模才能充分发挥其设计能力;建议初期可参考其 SDK 设计思路,结合云厂商 VM/容器服务作简化实现。
写在最后
DSec 的意义不仅在于突破沙盒创建性能极限,更在于确立了 Agent 训练基础设施的_new standard_:当模型推理成熟后,环境供给能力将成为评估大模型工程化水平的关键指标。这一趋势正从 AI 计算走向真实世界交互闭环的必然阶段。

