DeepSeek 于周四发布其主打成本与延迟优化的 Flash 模型更新版本 V4.1。这一版本号看似只是小幅迭代,但架构层面的改动幅度超出一般点版本,可能为更大、更聪明且资源占用更低的模型打开空间。

最直观的变化是规模:V4.1 Flash 参数量达到 7630 亿,是它所取代的上一代 Flash 的 2.5 倍以上,甚至超过了 2025 年初让 DeepSeek 进入主流视野的 V3 与 R1。但参数暴涨并未带来同等幅度的显存需求膨胀,这正是该版本的核心看点。

DeepSeek 主要通过两项改进实现这一点。其一是对 KV 缓存(用于跨多轮会话追踪模型状态)的处理方式做了大幅调整。KV 缓存在聊天机器人这类高吞吐场景中极为吃内存。通过对模型多种注意力机制的更新,并引入新的因果编码器-解码器(CED),开发团队在提升提示词处理性能的同时,把 KV 缓存消耗压缩到 V4 Flash 的 13% 至 25%。换算过来,在相同的 KV 缓存占用下,V4.1 可支撑的用户数是此前的 4 到 8 倍

其二是引入了一种不同类型的模型权重。在 7630 亿参数中,有 1960 亿为 N-gram 参数,构成 DeepSeek 开发者所称的「条件记忆模块」。其思路是把记忆与计算解耦:模型因此可以更聪明,同时服务它所需的计算与内存资源反而下降。

N-gram 本质上是 token 的组合,比如三 gram 就是连续三个 token。它的工作方式类似词语或短语联想——当被问到「已知直角三角形两边,求参数」时,熟悉几何的人脑中会立刻浮现「用勾股定理」或「A²+B²=C²」。V4.1 Flash 中的 N-gram 权重扮演的正是这种隐式知识或固化记忆的角色:传统大模型靠计算 token 组合的概率来作答,N-gram 权重则通过一次廉价的查表,快速把相关信息推到前台,作为补充。

严格说,模型查的并非原始提示词,而是一串哈希值——代表「求参数」「直角三角形」等概念的数学表示;查表返回的也不是现成答案,而是称为向量的数学表示,再送入推理管线。但最终效果一致:模型能给出更聪明、更细致的回答,而不必承受通常伴随参数增加而来的性能代价。

N-gram 之所以「便宜」,与数据访问方式有关。现代大模型在解码阶段是自回归的:每生成一个 token,都要从内存中读取全部活跃权重,带宽因此成为瓶颈。混合专家模型、超低精度块浮点数据类型等架构变化都在缓解这一瓶颈。而 V4.1 Flash 的 N-gram 权重本质上是一张巨大的查找表(LUT),查询快且成本低——每生成一个 token 只需几十次表查询,无需把全部活跃参数从内存读出。

这带来一个关键结果:N-gram 权重不必全部塞进 GPU 显存来维持性能,可以卸载到系统内存,甚至可能放到速度足够快的存储阵列上。以 V4.1 Flash 为例,若以 FP8 精度在 GPU 显存中保存全部权重,理论上至少需要 763 GB;而把 N-gram 权重卸载到更便宜的系统内存后,GPU 显存需求可降至约 567 GB。需要强调的是,这是最低门槛——生产环境中还要计入随上下文长度和并发用户数增长的 KV 缓存,实际占用会显著更高。

从产业视角看,这条路线与 Google Gemma 团队早前提出的 Per-Layer Embedding(PLE) 在思路上有相似之处,目标都是让模型在带宽、内存与算力受限的设备上也能有效运行;DeepSeek 的实现则用 N-gram 替换了 PLE 嵌入,相关思路最早见于其今年 1 月的一篇研究论文。对关注 AI 基础设施的读者而言,值得留意的不是单次发布的参数数字,而是「记忆与计算解耦」是否会成为下一阶段模型设计的通用范式:如果推理侧对高端显存和内存带宽的依赖被结构性削弱,云厂商的单位推理成本曲线、GPU 采购结构乃至模型厂商之间的成本竞争格局,都可能随之调整。