DeepSeek 在 Hugging Face 上发布了 DeepSeek-V4.1-Flash,这是一款原生支持图像与文本输入、自回归生成文本的多模态混合专家(MoE)模型。模型卡片显示其总参数规模为 763B,其中骨干参数 552B,支持最长 100 万 token 的上下文窗口,采用 MIT 许可证,并已适配 transformers 库。
这款模型最核心的卖点是 KV 缓存压缩。DeepSeek 在技术报告中称,V4.1-Flash 把全局 KV 缓存占用压到 每 token 890 字节,约为上一代 DeepSeek-V4-Flash 的四分之一,相比更早的 DeepSeek-V1 则降低了约 437 倍。这一改进直接关系到长上下文推理时的显存开销与部署成本。
架构上,V4.1-Flash 采用因果编码器-解码器(CED)设计:一个 40 层 Transformer 被拆成 20 层因果编码器加 20 层解码器。解码器的全局 KV 缓存由编码器最终隐藏状态投影而来,而非逐层自行推导,因此模型在预填充阶段每个 token 仅激活 8B 参数、解码阶段激活 16B 参数。DeepSeek 表示,这种设计对输入密集的智能体(agentic)负载尤其能改善成本效率。
为配合长上下文,模型还引入多项机制。SWA 有界重放通过只回放最近若干 token 来重建缺失的滑动窗口注意力 KV 状态,避免把 SWA KV 持久化到 SSD,把持久化 KV 缓存占用降到 V4-Flash 的约八分之一。压缩稀疏注意力 CSA2 为每个注意力层分配 Full、Reindex 或 Reuse 三种静态模式之一,跨层共享主 KV 与索引器 K,并复用 Top-K 稀疏注意力索引;解码器中的分层稀疏索引器进一步把后续索引层限制在首个 Full 模式层构建的候选池内,使深层索引成本不随上下文长度线性增长。配合 FP4 主 KV 缓存(E2M1 格式,每 16 通道一个 E4M3 缩放因子),共同实现上述缓存压缩效果。
其他组件包括单遍 mHC 残差流混合、Engram 条件记忆(196B 参数,通过基于 token 的查找稀疏访问)以及 DSpark 推测解码。每个 MoE 层配置 1 个共享专家和 384 个路由专家,每个 token 激活其中 6 个路由专家。多模态方面,视觉编码器 DeepSeek-ViT 从零训练,采用 2D-RoPE 与 3×3 像素反洗牌下采样,再经两层 MLP 投影器转为视觉嵌入,从语言模型预训练一开始就与文本嵌入联合处理。
预训练方面,模型从零在 45T token 的多模态语料上训练,稀疏注意力在 64K 序列长度下训练,并在 34T token 处把上下文扩展到 100 万 token。后训练沿用标准的 SFT → RL → 在线策略蒸馏流程,未做算法改动,主要变化在数据管线:大规模自动合成智能体任务与环境,并逐步扩展数据、任务与 rollout 规模。模型还支持 1 至 100 的连续可控推理强度,用以在推理成本与准确率之间取舍。
评测数据显示,基础模型在 MMLU-Pro 上得分 74.1,高于 V4-Flash-Base 的 68.3 和 V4-Pro-Base 的 73.5;HumanEval 得分 79.4,GSM8K 为 93.0。多模态基准上,MMMU-Pro 为 56.5,DocVQA 达 95.6,RefCOCO-avg 为 86.0。在指令模型对比中,V4.1-Flash 在 Codeforces 上取得 3471 的评分,高于 DS-V4-Pro 的 3348 和 DS-V4-Flash 的 3289;GPQA Diamond 为 90.9,略低于 V4-Pro 的 92.4。
从产业视角看,V4.1-Flash 延续了 DeepSeek 以架构与缓存优化压低推理成本、同时用 MoE 控制激活参数量的路线。对关注 AI 基础设施的投资者而言,这类模型若被广泛采用,可能改变长上下文与智能体负载对显存和算力的需求结构,也会影响开源模型与闭源前沿模型之间的性价比竞争。模型的实际部署表现与生态采用情况,仍需后续观察。