DeepSeek弹性计算团队正在大规模招聘,尤其需要资深工程师。与三周前那轮招聘不同,这次没有发布岗位JD,而是直接发布了一篇技术分享《DeepSeek弹性计算(DSec):面向大规模Agent训练的沙盒基础设施》,用生产数据说明团队为何需要继续扩张。
DSec是支撑DeepSeek-V4全部训练、评测和数据预处理流程的沙盒基础设施。从DeepSeek-V3.2一路到V4.1,Agent训练、评测和数据预处理产生的全部沙盒负载都已运行在DSec上。目前一套DSec扩展分片大约有160台服务器、3万个CPU核心和250TB内存,每天服务约300万个沙盒;高峰期同时在线沙盒超过38万个,每秒可创建5000多个。DeepSeek已在生产环境部署多个这样的分片,能够支持数百万个沙盒同时运行。
Agent训练的工作负载与普通云计算有明显差异。模型需要不断进入真实环境执行任务,读代码、改文件、安装依赖、执行测试、运行服务,每一步都会改变环境状态,下一轮交互又要接着前面的状态继续。因此沙盒既要能快速大批量创建,又不能每执行一步就销毁重来。DeepSeek总结这类负载的特点包括:创建请求会突然集中涌入;CPU大部分时间空闲,但内存需持续保留文件和进程状态;不同任务所需环境差异大;基础镜像复用率不高;训练过程还可能因GPU资源被抢占而中断。
围绕这些特点,DSec做了多项优化。环境层面,DeepSeek统计2026年某一周的生产数据发现,仅Container后端就用到11266个基础镜像、102171个工作区以及数百个工具包。若按传统方法为每种组合做完整镜像,代码仓库或工具包稍有更新就可能触发大批镜像重建。DSec将环境拆成三层:操作系统和基础软件放入base image,任务代码和依赖放入workspace,DeepSeek Harness等工具单独做成toolkit,三部分分别管理版本,创建沙盒时再组合,工具更新只需重建对应层。
镜像加载方面,生产数据显示Agent实际访问的数据只占整个镜像的4.2%到13.3%,提前完整下载几十GB环境并不划算。DSec将镜像数据统一放到自有的3FS分布式文件系统,本地主要保存元数据,需要时按需读取。集中创建8192个Container的测试中,完整拉取镜像需60多分钟,按需加载缩短到约35分钟,速度提升约1.71倍,磁盘写入量减少约57%。另一工作区实验中,改用直接挂载EROFS层后,任务从79分钟缩短到45分钟,磁盘写入总量降至约原来的1/5.5。
资源利用方面,DeepSeek发现约90%的沙盒平均CPU使用量不到申请资源的5%,因为Agent完成操作后通常要等待模型生成下一步动作,期间CPU闲置但内存不能释放。目前生产环境资源超卖率已超过50倍。为缓解内存瓶颈,DSec通过virtio-pmem和DAX让同一宿主机上的MicroVM共享宿主页缓存,单独启用该机制使实验宿主机峰值内存占用较基线下降40.2%;借助DAMON和balloon空闲页报告回收,按时间累计的内存消耗还能再降低21.2%。CPU调度上,DSec优先保障时延敏感任务,实验显示当同机其他任务已占节点50% CPU容量时,时延敏感任务受到的延迟影响从45.2%降至17.3%。
DSec目前统一支持四种执行后端:FnCall、Container、MicroVM和Full VM,分别覆盖短任务、软件工程与工具调用、更强隔离以及完整操作系统(支持GUI、图形渲染甚至Android应用)等场景。DeepSeek还采用“用Agent给Agent造环境”的方式,通过pack_diff机制让Agent在沙盒中配置好环境后生成增量快照,需要时从快照恢复,甚至每执行一步都可保存为可复用环境。这带来了轨迹分叉能力:在第k步保存快照后,可从相同状态恢复多个沙盒并行探索不同分支,前序环境和数据共享,只有后续变化单独记录,无需重放前k步。
从DeepSeek-V4.1开始,Agent执行逻辑被迁入DSec,Agent沙盒和worker container运行在可抢占GPU资源池之外,即使GPU任务中断,Agent执行进度和环境状态仍能保存,GPU恢复后训练可从中断处继续。
安全方面,DeepSeek表示已在真实生产环境观察到Agent尝试读取残留答案、伪造RPC请求、覆盖/bin/bash注入命令,甚至调用XFS_IOC_SWAPEXT绕过访问控制。DSec通过AppArmor限制文件和Socket访问,即使Agent获得管理员权限规则依然有效;网络侧利用eBPF为每个沙盒设置白名单,限定可连接的地址、端口和协议。但DeepSeek也承认,若Agent进一步找到内核漏洞,目前仍缺少通用防御机制,随着模型能力提高,攻防还会持续。
从产业视角看,DSec的细节披露展示了DeepSeek在Agent训练基础设施上的工程投入方向:通过镜像分层、按需加载、内存共享、CPU调度和安全隔离,压低单个Agent环境的资源成本,以支撑更大规模并发。团队继续扩招,意味着其正为Agent运行环境数量和种类扩充成百上千倍的目标储备工程能力,这也可能影响后续模型迭代节奏与训练效率。