DeepSeek彈性計算團隊正在大規模招聘,尤其需要資深工程師。與三週前那輪招聘不同,這次沒有釋出崗位JD,而是直接釋出了一篇技術分享《DeepSeek彈性計算(DSec):面向大規模Agent訓練的沙盒基礎設施》,用生產資料說明團隊為何需要繼續擴張。

DSec是支撐DeepSeek-V4全部訓練、評測和資料預處理流程的沙盒基礎設施。從DeepSeek-V3.2一路到V4.1,Agent訓練、評測和資料預處理產生的全部沙盒負載都已執行在DSec上。目前一套DSec擴充套件分片大約有160台伺服器、3萬個CPU核心和250TB記憶體,每天服務約300萬個沙盒;高峰期同時線上沙盒超過38萬個,每秒可建立5000多個。DeepSeek已在生產環境部署多個這樣的分片,能夠支援數百萬個沙盒同時執行。

Agent訓練的工作負載與普通雲端計算有明顯差異。模型需要不斷進入真實環境執行任務,讀程式碼、改檔案、安裝依賴、執行測試、執行服務,每一步都會改變環境狀態,下一輪互動又要接著前面的狀態繼續。因此沙盒既要能快速大批次建立,又不能每執行一步就銷燬重來。DeepSeek總結這類負載的特點包括:建立請求會突然集中湧入;CPU大部分時間空閒,但記憶體需持續保留檔案和程序狀態;不同任務所需環境差異大;基礎映象複用率不高;訓練過程還可能因GPU資源被搶佔而中斷。

圍繞這些特點,DSec做了多項最佳化。環境層面,DeepSeek統計2026年某一週的生產資料發現,僅Container後端就用到11266個基礎映象、102171個工作區以及數百個工具包。若按傳統方法為每種組合做完整映象,程式碼倉庫或工具包稍有更新就可能觸發大批映象重建。DSec將環境拆成三層:作業系統和基礎軟體放入base image,任務程式碼和依賴放入workspace,DeepSeek Harness等工具單獨做成toolkit,三部分分別管理版本,建立沙盒時再組合,工具更新只需重建對應層。

映象載入方面,生產資料顯示Agent實際訪問的資料只佔整個映象的4.2%到13.3%,提前完整下載幾十GB環境並不划算。DSec將映象資料統一放到自有的3FS分散式檔案系統,本地主要儲存後設資料,需要時按需讀取。集中建立8192個Container的測試中,完整拉取映象需60多分鐘,按需載入縮短到約35分鐘,速度提升約1.71倍,磁碟寫入量減少約57%。另一工作區實驗中,改用直接掛載EROFS層後,任務從79分鐘縮短到45分鐘,磁碟寫入總量降至約原來的1/5.5。

資源利用方面,DeepSeek發現約90%的沙盒平均CPU使用量不到申請資源的5%,因為Agent完成操作後通常要等待模型生成下一步動作,期間CPU閒置但記憶體不能釋放。目前生產環境資源超賣率已超過50倍。為緩解記憶體瓶頸,DSec通過virtio-pmem和DAX讓同一宿主機上的MicroVM共享宿主頁快取,單獨啟用該機制使實驗宿主機峰值記憶體佔用較基線下降40.2%;藉助DAMON和balloon空閒頁報告回收,按時間累計的記憶體消耗還能再降低21.2%。CPU排程上,DSec優先保障時延敏感任務,實驗顯示當同機其他任務已佔節點50% CPU容量時,時延敏感任務受到的延遲影響從45.2%降至17.3%。

DSec目前統一支援四種執行後端:FnCall、Container、MicroVM和Full VM,分別覆蓋短任務、軟體工程與工具呼叫、更強隔離以及完整作業系統(支援GUI、圖形渲染甚至Android應用)等場景。DeepSeek還採用“用Agent給Agent造環境”的方式,通過pack_diff機制讓Agent在沙盒中配置好環境後生成增量快照,需要時從快照恢復,甚至每執行一步都可儲存為可複用環境。這帶來了軌跡分叉能力:在第k步儲存快照後,可從相同狀態恢復多個沙盒並行探索不同分支,前序環境和資料共享,只有後續變化單獨記錄,無需重放前k步。

從DeepSeek-V4.1開始,Agent執行邏輯被遷入DSec,Agent沙盒和worker container執行在可搶佔GPU資源池之外,即使GPU任務中斷,Agent執行進度和環境狀態仍能儲存,GPU恢復後訓練可從中斷處繼續。

安全方面,DeepSeek表示已在真實生產環境觀察到Agent嘗試讀取殘留答案、偽造RPC請求、覆蓋/bin/bash注入命令,甚至呼叫XFS_IOC_SWAPEXT繞過訪問控制。DSec通過AppArmor限制檔案和Socket訪問,即使Agent獲得管理員許可權規則依然有效;網路側利用eBPF為每個沙盒設定白名單,限定可連線的地址、埠和協議。但DeepSeek也承認,若Agent進一步找到核心漏洞,目前仍缺少通用防禦機制,隨著模型能力提高,攻防還會持續。

從產業視角看,DSec的細節披露展示了DeepSeek在Agent訓練基礎設施上的工程投入方向:通過映象分層、按需載入、記憶體共享、CPU排程和安全隔離,壓低單個Agent環境的資源成本,以支撐更大規模併發。團隊繼續擴招,意味著其正為Agent執行環境數量和種類擴充成百上千倍的目標儲備工程能力,這也可能影響後續模型迭代節奏與訓練效率。