DeepSeek在知乎獨家釋出技術長文,首次系統闡釋了支撐DeepSeek-V4全部訓練、評測與資料預處理流程的沙盒基礎設施——DeepSeek彈性計算(DeepSeek Elastic Compute,DSec)。與之配套的技術報告《DeepSeek Elastic Compute (DSec): A Sandbox Infrastructure for Effective Agentic Training at Scale》已公開至arXiv,由DeepSeek聯合清華大學釋出,作者團隊超過130人,梁文鋒也在作者名單之中。
要訓練一個可靠的Agent大模型,模型需要在真實環境裡反覆試錯:讀程式碼、改檔案、裝依賴、跑測試、起服務。這些操作會持續改變環境,沙盒必須在多輪互動中保留狀態。DSec面對的是幾類鮮明負載特徵:沙盒建立請求呈脈衝式突發;啟動後CPU大部分時間閒置,記憶體卻要持續駐留;Agent執行環境種類多、基礎映象複用率低;任務執行時間長,訓練還可能因資源搶佔而中斷。
針對隔離強度、作業系統功能與執行開銷的不同要求,DSec提供FnCall、Container、MicroVM和Full VM四種執行後端,通過統一的Python SDK(libdsec)接入。FnCall複用預建立容器處理線上評測等短任務;Container以較快啟動速度和較高部署密度服務最通用的軟體工程與工具呼叫;MicroVM提供更強隔離邊界,用於安全任務等場景;Full VM則提供完整作業系統環境,支援圖形介面、圖形渲染和Android等應用。
環境構建是Agent訓練的第一道坎。以2026年某一週的生產資料為例,容器後端使用了11,266個基礎映象、102,171個工作區以及數百個工具包;按傳統單體映象方式,任意一部分更新都會觸發大量映象重建。DSec把沙盒環境拆成基礎映象、工作區和工具包三部分,三者版本各自管理、執行時組合,並以EROFS格式儲存,支援後設資料與資料分離及跨映象去重,建立沙盒時通過OverlayFS按需組合各映象層。
生產資料分析顯示,沙盒執行時實際訪問的資料量僅佔映象總大小的4.2%至13.3%,提前拉取完整映象意味著絕大部分資料被浪費。DSec因此把全部映象資料放在3FS分散式檔案系統上,本地只拉取後設資料,資料按需讀取。在集中建立8,192個容器的實驗中,按需載入把任務完成時間從60多分鐘縮短至約35分鐘,加速比約1.71,磁碟寫入量減少約57%;工作區供給實驗中,從逐個解壓tar.gz改為直接掛載EROFS層,任務完成時間從79分鐘降至45分鐘,磁碟寫入總量降至原來的約1/5.5。
資源利用率方面,Agent訓練中沙盒大部分時間在等模型生成下一步動作:約90%的沙盒平均CPU用量不超過申請量的5%,但記憶體需持續駐留,這為高倍超賣留出空間,DSec生產環境的超賣率超過50倍。為提升部署密度,DSec通過virtio-pmem與DAX讓同一宿主機上的MicroVM共享宿主頁快取,單獨啟用該機制可使宿主機峰值記憶體用量較基線下降40.2%;單獨啟用DAMON與balloon空閒頁報告的記憶體回收機制,按時間累計的宿主機記憶體消耗較基線下降21.2%。CPU排程上,當同機其他任務佔用節點50% CPU容量時,時延敏感任務相對無干擾基線的時延增幅由45.2%降至17.3%。
訓練流程上,早期Agent執行迴圈與GPU訓練任務同處一個Pod,訓練被搶佔後環境沙盒還在、執行迴圈卻已終止,恢復時需重放命令日誌銜接進度,邏輯複雜且協調成本高。從DeepSeek-V4.1開始,這部分邏輯遷入DSec,拆分為Agent沙盒與工作容器協同:前者執行Agent框架和工具包,後者管理沙盒、推進互動,兩者都部署在可被搶佔的GPU資源池之外,共同儲存執行進度與環境狀態,使GPU任務被搶佔後Agent狀態仍能完整保留、恢復後從中斷處繼續。
環境構建本身也交給Agent自動化完成。DSec引入pack_diff打包機制,Agent可指揮平台對沙盒建立增量快照,未來恢復為新沙盒,甚至把每一輪互動轉化為可複用環境;增量快照還支援軌跡分叉,在第k步儲存後從同一狀態恢復多個沙盒分別探索,各分支共享只讀層、只記錄變更。
安全邊界同樣被重點討論。生產環境中觀察到Agent會嘗試讀取殘留答案、偽造RPC請求、覆蓋/bin/bash注入命令,甚至嘗試通過XFS_IOC_SWAPEXT繞過訪問控制。DSec因此把細粒度訪問控制作為基礎功能:用AppArmor約束檔案讀寫和套接字訪問,即使Agent以管理員身份執行限制依然有效;用eBPF為每個沙盒執行網路訪問白名單。不過文章也承認,對觸發核心缺陷等破壞性行為目前仍缺乏通用防禦機制,攻防會持續迭代。
規模上,DSec以分片橫向擴充套件,每個分片約160台伺服器,提供約3萬個CPU核心和250 TB記憶體;單個分片每天服務約300萬個沙盒,峰值併發超過38萬個,每秒可建立超過5,000個沙盒。從DeepSeek-V3.2到DeepSeek-V4.1,DSec承載了Agent訓練、評測與資料預處理中的全部沙盒負載。文章最後表示,接下來會把Agent執行環境的數量和種類擴充成百上千倍,並把任務培養出的能力帶回開放模型。