9 月 19 日,DeepSeek 在 arXiv 更新了一篇 31 页的新论文《DSec:面向大规模智能体训练的高效沙箱基础设施》,首次对外展示其自动化沙箱系统 DSec(DeepSeek Elastic Compute)。该系统定位为 DeepSeek 内部超大规模智能体(Agent)强化学习与评测体系的生产级底座,可为每一次训练任务秒级创建独立的虚拟环境。论文显示,DSec 每日可自动运行 300 万个沙箱环境,单生产单元横跨 160 个 CPU 节点,并通过严苛的权限隔离防止 AI 作弊,同时精准复现 AI 在沙箱内每一步的环境反馈。该论文的通讯作者为 梁文锋。

这篇论文之所以受到关注,与 DeepSeek 近三年的技术路径有关。据雷锋网梳理,过去三年梁文锋署名了 11 篇论文,这些论文并非旗舰模型的整体报告,而是集中在最底层的原子技术上。他极少以第一作者或通讯作者身份出现在动辄上百人署名的旗舰模型报告中,却始终把名字签在 MLA 注意力、MoE 路由机制、mHC 拓扑流形、DSpark 推理算子、DSec 智能体沙盒等底层技术论文上。

从时间线看,这 11 篇论文大致可分为几个阶段。2024 年初,大模型行业深陷算力军备竞赛,稠密模型的缩放定律几乎等同于烧钱定律,万卡集群与数亿美元投入门槛把赛道圈成巨头俱乐部。梁文锋团队在这一阶段发布《DeepSeek LLM》《DeepSeekMoE》《DeepSeek-V2》。其中《DeepSeek LLM》提出在算力固定前提下,提升数据质量与数据密度比盲目扩大参数更有效,其 67B 参数版本在代码、数学与推理基准上反超当时的开源标杆 Llama-2 70B,并在开放对话测试中击败 GPT-3.5。随后《DeepSeekMoE》通过细粒度专家动态路由与共享专家隔离,将训练开销降低 42.5%;首创的 MLA 多头潜在注意力机制利用低秩潜在向量压缩,将 KV Cache 体积极限压缩 93.3%。基于这些技术的 DeepSeek-V2 把千 token 推理成本打到此前几十分之一,直接引爆国内大模型 API 价格战。

2024 年至 2025 年,梁文锋团队把低成本路线推向闭源模型的智力高地。2024 年 6 月发布的《DeepSeek-Coder-V2》注入 6 万亿高质量中英代码与数学数据进行持续预训练,支持编程语言从 86 种扩充至 338 种,上下文窗口拉满至 128K,在 HumanEval、Codeforces、LiveCodeBench 等主流代码基准上首次全面超越 GPT-4 Turbo、Claude 3 Opus 等闭源顶级模型。其每百万 Token 输入价格仅 0.14 美元、输出价格仅 0.28 美元,而当时 GPT-4 Turbo 每百万 Token 输入需 10.00 美元、输出高达 30.00 美元。

2024 年底,团队在不到 2 个月内仅凭 2048 块 H800 显卡从头训出顶级模型 DeepSeek-V3,参数高达 671B,总成本 560 万美元。论文披露的三项关键优化包括:无辅助损失的专家负载均衡策略、更精简的 FP8 数值精度训练,以及让数值计算与数据传输并行启动以压缩硬件空闲时间。2025 年春节前后发布的《DeepSeek-R1》则提出组相对策略优化(GRPO)算法,首次严谨证明无需大规模监督微调、仅通过纯强化学习即可让大模型自主涌现链式思考能力,整个强化学习阶段仅耗资 29.4 万美元。该成果后来登上《Nature》杂志封面,成为首个获此认可的主流大模型成果。

在推理能力之外,梁文锋的署名还向更底层延伸。2025 年 2 月提交的《Native Sparse Attention(原生稀疏注意力,NSA)》用 Triton 语言重写底层硬件计算算子,设计分层动态稀疏策略,让稀疏计算访问节奏对齐 NVIDIA GPU Tensor Core 的微观电路结构,使模型前向传播速度提升 9 倍、长序列解码速度拉高 11.6 倍,该论文斩获 ACL 2025 最佳论文奖。2025 年 6 月发表于 ISCA 的《Insights into DeepSeek-V3》则从计算机体系结构视角拆解大规模 MoE 训练的内存墙与通信墙瓶颈,分析 MLA、MoE 路由、FP8 精度与 GPU 硬件的协同关系,并给出下一代 AI 加速芯片的设计建议。

最新这篇 DSec 论文,则把视角转向智能体训练的安全与效率。在 Agent 能力不断增强、甚至出现隐藏思维链等行为的背景下,沙箱不再只是附庸的安全配件,而同时承担 AI 进化的训练场与限制其破坏力的防线。对关注 AI 产业的读者而言,这条线索的价值在于:DeepSeek 的技术叙事并不只围绕模型参数或榜单排名,而是持续押注底层工程效率、训练成本与安全隔离能力——这些能力最终会传导到推理成本、智能体应用落地门槛,以及国产大模型在算力受限环境下的竞争力上。