DeepSeek 於週四釋出其主打成本與延遲最佳化的 Flash 模型更新版本 V4.1。這一版本號看似只是小幅迭代,但架構層面的改動幅度超出一般點版本,可能為更大、更聰明且資源佔用更低的模型開啟空間。

最直觀的變化是規模:V4.1 Flash 引數量達到 7630 億,是它所取代的上一代 Flash 的 2.5 倍以上,甚至超過了 2025 年初讓 DeepSeek 進入主流視野的 V3 與 R1。但引數暴漲並未帶來同等幅度的視訊記憶體需求膨脹,這正是該版本的核心看點。

DeepSeek 主要通過兩項改進實現這一點。其一是對 KV 快取(用於跨多輪會話追蹤模型狀態)的處理方式做了大幅調整。KV 快取在聊天機器人這類高吞吐場景中極為吃記憶體。通過對模型多種注意力機制的更新,並引入新的因果編碼器-解碼器(CED),開發團隊在提升提示詞處理效能的同時,把 KV 快取消耗壓縮到 V4 Flash 的 13% 至 25%。換算過來,在相同的 KV 快取佔用下,V4.1 可支撐的使用者數是此前的 4 到 8 倍

其二是引入了一種不同型別的模型權重。在 7630 億引數中,有 1960 億為 N-gram 引數,構成 DeepSeek 開發者所稱的「條件記憶模組」。其思路是把記憶與計算解耦:模型因此可以更聰明,同時服務它所需的計算與記憶體資源反而下降。

N-gram 本質上是 token 的組合,比如三 gram 就是連續三個 token。它的工作方式類似詞語或短語聯想——當被問到「已知直角三角形兩邊,求引數」時,熟悉幾何的人腦中會立刻浮現「用勾股定理」或「A²+B²=C²」。V4.1 Flash 中的 N-gram 權重扮演的正是這種隱式知識或固化記憶的角色:傳統大模型靠計算 token 組合的機率來作答,N-gram 權重則通過一次廉價的查表,快速把相關資訊推到前台,作為補充。

嚴格說,模型查的並非原始提示詞,而是一串雜湊值——代表「求引數」「直角三角形」等概念的數學表示;查表返回的也不是現成答案,而是稱為向量的數學表示,再送入推理管線。但最終效果一致:模型能給出更聰明、更細緻的回答,而不必承受通常伴隨引數增加而來的效能代價。

N-gram 之所以「便宜」,與資料訪問方式有關。現代大模型在解碼階段是自迴歸的:每生成一個 token,都要從記憶體中讀取全部活躍權重,頻寬因此成為瓶頸。混合專家模型、超低精度塊浮點資料型別等架構變化都在緩解這一瓶頸。而 V4.1 Flash 的 N-gram 權重本質上是一張巨大的查詢表(LUT),查詢快且成本低——每生成一個 token 只需幾十次表查詢,無需把全部活躍引數從記憶體讀出。

這帶來一個關鍵結果:N-gram 權重不必全部塞進 GPU 視訊記憶體來維持效能,可以解除安裝到系統記憶體,甚至可能放到速度足夠快的儲存陣列上。以 V4.1 Flash 為例,若以 FP8 精度在 GPU 視訊記憶體中儲存全部權重,理論上至少需要 763 GB;而把 N-gram 權重解除安裝到更便宜的系統記憶體後,GPU 視訊記憶體需求可降至約 567 GB。需要強調的是,這是最低門檻——生產環境中還要計入隨上下文長度和併發使用者數增長的 KV 快取,實際佔用會顯著更高。

從產業視角看,這條路線與 Google Gemma 團隊早前提出的 Per-Layer Embedding(PLE) 在思路上有相似之處,目標都是讓模型在頻寬、記憶體與算力受限的裝置上也能有效執行;DeepSeek 的實現則用 N-gram 替換了 PLE 嵌入,相關思路最早見於其今年 1 月的一篇研究論文。對關注 AI 基礎設施的讀者而言,值得留意的不是單次釋出的引數數字,而是「記憶與計算解耦」是否會成為下一階段模型設計的通用範式:如果推理側對高階視訊記憶體和記憶體頻寬的依賴被結構性削弱,雲廠商的單位推理成本曲線、GPU 採購結構乃至模型廠商之間的成本競爭格局,都可能隨之調整。