DeepSeek 在 Hugging Face 上釋出了 DeepSeek-V4.1-Flash,這是一款原生支援影像與文本輸入、自迴歸生成文本的多模態混合專家(MoE)模型。模型卡片顯示其總引數規模為 763B,其中骨幹引數 552B,支援最長 100 萬 token 的上下文視窗,採用 MIT 許可證,並已適配 transformers 庫。
這款模型最核心的賣點是 KV 快取壓縮。DeepSeek 在技術報告中稱,V4.1-Flash 把全域性 KV 快取佔用壓到 每 token 890 位元組,約為上一代 DeepSeek-V4-Flash 的四分之一,相比更早的 DeepSeek-V1 則降低了約 437 倍。這一改進直接關係到長上下文推理時的視訊記憶體開銷與部署成本。
架構上,V4.1-Flash 採用因果編碼器-解碼器(CED)設計:一個 40 層 Transformer 被拆成 20 層因果編碼器加 20 層解碼器。解碼器的全域性 KV 快取由編碼器最終隱藏狀態投影而來,而非逐層自行推導,因此模型在預填充階段每個 token 僅啟用 8B 引數、解碼階段啟用 16B 引數。DeepSeek 表示,這種設計對輸入密集的智慧體(agentic)負載尤其能改善成本效率。
為配合長上下文,模型還引入多項機制。SWA 有界重放通過只回放最近若干 token 來重建缺失的滑動視窗注意力 KV 狀態,避免把 SWA KV 持久化到 SSD,把持久化 KV 快取佔用降到 V4-Flash 的約八分之一。壓縮稀疏注意力 CSA2 為每個注意力層分配 Full、Reindex 或 Reuse 三種靜態模式之一,跨層共享主 KV 與索引器 K,並複用 Top-K 稀疏注意力索引;解碼器中的分層稀疏索引器進一步把後續索引層限制在首個 Full 模式層構建的候選池內,使深層索引成本不隨上下文長度線性增長。配合 FP4 主 KV 快取(E2M1 格式,每 16 通道一個 E4M3 縮放因子),共同實現上述快取壓縮效果。
其他元件包括單遍 mHC 殘差流混合、Engram 條件記憶(196B 引數,通過基於 token 的查詢稀疏訪問)以及 DSpark 推測解碼。每個 MoE 層配置 1 個共享專家和 384 個路由專家,每個 token 啟用其中 6 個路由專家。多模態方面,視覺編碼器 DeepSeek-ViT 從零訓練,採用 2D-RoPE 與 3×3 畫素反洗牌下采樣,再經兩層 MLP 投影器轉為視覺嵌入,從語言模型預訓練一開始就與文本嵌入聯合處理。
預訓練方面,模型從零在 45T token 的多模態語料上訓練,稀疏注意力在 64K 序列長度下訓練,並在 34T token 處把上下文擴充套件到 100 萬 token。後訓練沿用標準的 SFT → RL → 線上策略蒸餾流程,未做演算法改動,主要變化在資料管線:大規模自動合成智慧體任務與環境,並逐步擴充套件資料、任務與 rollout 規模。模型還支援 1 至 100 的連續可控推理強度,用以在推理成本與準確率之間取捨。
評測資料顯示,基礎模型在 MMLU-Pro 上得分 74.1,高於 V4-Flash-Base 的 68.3 和 V4-Pro-Base 的 73.5;HumanEval 得分 79.4,GSM8K 為 93.0。多模態基準上,MMMU-Pro 為 56.5,DocVQA 達 95.6,RefCOCO-avg 為 86.0。在指令模型對比中,V4.1-Flash 在 Codeforces 上取得 3471 的評分,高於 DS-V4-Pro 的 3348 和 DS-V4-Flash 的 3289;GPQA Diamond 為 90.9,略低於 V4-Pro 的 92.4。
從產業視角看,V4.1-Flash 延續了 DeepSeek 以架構與快取最佳化壓低推理成本、同時用 MoE 控制啟用引數量的路線。對關注 AI 基礎設施的投資者而言,這類模型若被廣泛採用,可能改變長上下文與智慧體負載對視訊記憶體和算力的需求結構,也會影響開源模型與閉源前沿模型之間的價效比競爭。模型的實際部署表現與生態採用情況,仍需後續觀察。