9 月 19 日,DeepSeek 在 arXiv 更新了一篇 31 頁的新論文《DSec:面向大規模智慧體訓練的高效沙箱基礎設施》,首次對外展示其自動化沙箱系統 DSec(DeepSeek Elastic Compute)。該系統定位為 DeepSeek 內部超大規模智慧體(Agent)強化學習與評測體系的生產級底座,可為每一次訓練任務秒級建立獨立的虛擬環境。論文顯示,DSec 每日可自動執行 300 萬個沙箱環境,單生產單元橫跨 160 個 CPU 節點,並通過嚴苛的許可權隔離防止 AI 作弊,同時精準復現 AI 在沙箱內每一步的環境反饋。該論文的通訊作者為 梁文鋒。

這篇論文之所以受到關注,與 DeepSeek 近三年的技術路徑有關。據雷鋒網梳理,過去三年梁文鋒署名了 11 篇論文,這些論文並非旗艦模型的整體報告,而是集中在最底層的原子技術上。他極少以第一作者或通訊作者身份出現在動輒上百人署名的旗艦模型報告中,卻始終把名字簽在 MLA 注意力、MoE 路由機制、mHC 拓撲流形、DSpark 推理運算元、DSec 智慧體沙盒等底層技術論文上。

從時間線看,這 11 篇論文大致可分為幾個階段。2024 年初,大模型行業深陷算力軍備競賽,稠密模型的縮放定律幾乎等同於燒錢定律,萬卡叢集與數億美元投入門檻把賽道圈成巨頭俱樂部。梁文鋒團隊在這一階段釋出《DeepSeek LLM》《DeepSeekMoE》《DeepSeek-V2》。其中《DeepSeek LLM》提出在算力固定前提下,提升資料質量與資料密度比盲目擴大引數更有效,其 67B 引數版本在程式碼、數學與推理基準上反超當時的開源標杆 Llama-2 70B,並在開放對話測試中擊敗 GPT-3.5。隨後《DeepSeekMoE》通過細粒度專家動態路由與共享專家隔離,將訓練開銷降低 42.5%;首創的 MLA 多頭潛在注意力機制利用低秩潛在向量壓縮,將 KV Cache 體積極限壓縮 93.3%。基於這些技術的 DeepSeek-V2 把千 token 推理成本打到此前幾十分之一,直接引爆國內大模型 API 價格戰。

2024 年至 2025 年,梁文鋒團隊把低成本路線推向閉源模型的智力高地。2024 年 6 月釋出的《DeepSeek-Coder-V2》注入 6 萬億高質量中英程式碼與數學資料進行持續預訓練,支援程式語言從 86 種擴充至 338 種,上下文視窗拉滿至 128K,在 HumanEval、Codeforces、LiveCodeBench 等主流程式碼基準上首次全面超越 GPT-4 Turbo、Claude 3 Opus 等閉源頂級模型。其每百萬 Token 輸入價格僅 0.14 美元、輸出價格僅 0.28 美元,而當時 GPT-4 Turbo 每百萬 Token 輸入需 10.00 美元、輸出高達 30.00 美元。

2024 年底,團隊在不到 2 個月內僅憑 2048 塊 H800 顯示卡從頭訓出頂級模型 DeepSeek-V3,引數高達 671B,總成本 560 萬美元。論文披露的三項關鍵最佳化包括:無輔助損失的專家負載均衡策略、更精簡的 FP8 數值精度訓練,以及讓數值計算與資料傳輸並行啟動以壓縮硬體空閒時間。2025 年春節前後釋出的《DeepSeek-R1》則提出組相對策略最佳化(GRPO)演算法,首次嚴謹證明無需大規模監督微調、僅通過純強化學習即可讓大模型自主湧現鏈式思考能力,整個強化學習階段僅耗資 29.4 萬美元。該成果後來登上《Nature》雜誌封面,成為首個獲此認可的主流大模型成果。

在推理能力之外,梁文鋒的署名還向更底層延伸。2025 年 2 月提交的《Native Sparse Attention(原生稀疏注意力,NSA)》用 Triton 語言重寫底層硬體計算運算元,設計分層動態稀疏策略,讓稀疏計算訪問節奏對齊 NVIDIA GPU Tensor Core 的微觀電路結構,使模型前向傳播速度提升 9 倍、長序列解碼速度拉高 11.6 倍,該論文斬獲 ACL 2025 最佳論文獎。2025 年 6 月發表於 ISCA 的《Insights into DeepSeek-V3》則從計算機體系結構視角拆解大規模 MoE 訓練的記憶體牆與通訊牆瓶頸,分析 MLA、MoE 路由、FP8 精度與 GPU 硬體的協同關係,並給出下一代 AI 加速晶片的設計建議。

最新這篇 DSec 論文,則把視角轉向智慧體訓練的安全與效率。在 Agent 能力不斷增強、甚至出現隱藏思維鏈等行為的背景下,沙箱不再只是附庸的安全配件,而同時承擔 AI 進化的訓練場與限制其破壞力的防線。對關注 AI 產業的讀者而言,這條線索的價值在於:DeepSeek 的技術敘事並不只圍繞模型引數或榜單排名,而是持續押注底層工程效率、訓練成本與安全隔離能力——這些能力最終會傳導到推理成本、智慧體應用落地門檻,以及國產大模型在算力受限環境下的競爭力上。