DeepSeek V4 Pro 是深度求索 V4 系列的旗舰档,DeepSeek V4.1 Flash 是 2026 年 9 月 10 日发布的新一代小尺寸模型。截至 2026 年 9 月 14 日,两者在官方 API 上并行在售:V4 Pro 的模型名是 deepseek-v4-pro(总参数 1.6T、每 token 激活 49B),V4.1 Flash 的模型名是 deepseek-flash(552B 主干参数、输入激活 8B/输出激活 16B)。两档上下文都是 1M、最大输出 384K,权重都以 MIT 许可开源。一句话区别:V4.1 Flash 更便宜、更快、Agent 编程跑分更高,还能看图;V4 Pro 世界知识更扎实、纯推理题和长文本题分数更高。

DeepSeek V4 Pro 和 V4.1 Flash 的区别

定位:V4 Pro 是 V4 一代(4 月 24 日发布)的大号旗舰;V4.1 Flash 是官方口中「全新模型结构系列中的最小尺寸」,结构换成了 Causal-Encoder-Decoder,不是 V4 Pro 的缩小版或蒸馏版。

参数:V4 Pro 为 MoE,总参 1.6T、激活 49B;V4.1 Flash 为 MoE,主干 552B,读输入(prefill)时每 token 激活 8B、生成输出(decode)时激活 16B,另带 196B 参数的 Engram 条件记忆模块(按 token 查表稀疏访问)。Hugging Face 页面按张量统计显示约 763B,与官方 552B 的主干口径不同,别混用。

能力(官方自测,max 思考档):按 V4.1 Flash 模型卡的对照表,Agent 与编程类 V4.1 Flash 全面领先——Terminal-Bench 2.1 90.6 对 87.9、DeepSWE v1.1 74.2 对 62.7、Terminal-Bench 4.0 31.2 对 12.4、Codeforces 3471 对 3348;但纯推理与知识题 V4 Pro 仍占上风——HLE 42.7 对 36.8、GPQA Diamond 92.4 对 90.9。基座模型对比里,V4 Pro 在 SimpleQA-Verified(55.2 对 42.3)和长文本 LongBench-V2(51.5 对 45.2)上明显更强。所以官方公告说 V4.1 Flash「全面超越 V4 Pro」,指的是性能、费用、速度、总用时这组综合指标,不等于每一项跑分都赢。

速度:第三方评测机构 Artificial Analysis 实测(Intelligence Index v4.3 口径,均为最高思考档):V4.1 Flash 输出约 214 token/秒、首 token 1.17 秒、综合指数 40;V4 Pro 0813 输出约 78 token/秒、首 token 1.67 秒、综合指数 36。实测速度随服务商和时段波动,只看量级。

价格:同一时段下,V4 Pro 的未命中输入价是 V4.1 Flash 的 4.5 倍、输出价约 3.4 倍、缓存命中输入价 7.5 倍。按高峰价粗算,100 万输入(未命中)加 100 万输出,V4.1 Flash 约 ¥10、V4 Pro 约 ¥36。

功能:两档都支持思考/非思考切换、JSON Output、Tool Calls、Responses API、Anthropic API、对话前缀续写,FIM 补全都只在非思考模式可用;图像理解只有 V4.1 Flash 支持,V4 Pro 在 API 侧不支持。并发上限 V4.1 Flash 2500、V4 Pro 500。

怎么选:跑 Claude Code、OpenCode 这类编程 Agent、批量长任务、需要看截图和图表,优先 V4.1 Flash;问答里对事实准确度要求高(冷门知识、专业百科)、或者已有流程在 V4 Pro 上调好了提示词,继续用 V4 Pro。拿不准就两档各跑一遍自己的样例再定,官方也保留了两个模型名。

正式版时间线:从预览版到 V4.1 Flash

2026-04-24:V4 预览版发布并开源,分 V4-Pro 与 V4-Flash 两档,1M 上下文成为官方服务标配;旧模型名 deepseek-chat/deepseek-reasoner 指向 V4-Flash,并于 7 月 24 日停用。2026-07-31:V4-Flash 正式版(0731)API 公测,结构与预览版一致、只重做了后训练,当时官方注明网页端与 App 未改。2026-08-13V4 Pro 正式版(0813)在 App、网页端和 API 同步上线,API 模型名不变,同时原生支持 Responses API、思考强度改为 low/high/max 三档,并宣布峰谷定价于 8 月 17 日 0 时生效。2026-08-21:多模态实验模型 V4-Flash-Vision-Exp 上线 API。

2026-09-10:V4.1 Flash 发布,新价当天 12:00 生效;旧的 V4 Flash 与 V4 Flash Vision Exp 下线,两个旧名暂时路由到 V4.1 Flash、按 Flash 价计费。公告原本还写着「北京时间 9 月 14 日 12:00 之后、V4.1 Pro 上线之前,deepseek-v4-pro 的请求全部路由到 V4.1 Flash」——但官方随后改口,更新日志与定价页脚注现写明:「为响应广大用户的需求,我们决定在 2026 年 9 月 14 日之后继续提供 DeepSeek V4 Pro 的 API 调用服务,计费方式保持不变」。所以并档没有发生,V4 Pro 正式版仍在售;官方同时说了「如有变动,我们将另行通知」。

搜索里常见的 expires-on-0910:据博客园一篇技术博文,9 月 8 日起官方曾限时开放内测模型名 deepseek-v4.1-flash-expires-on-0910(每账号 20 并发、按 V4 Flash 价计费、9 月 10 日自动过期)。官方更新日志没有收录这一条,本页未能在官方文档核实;无论如何它已过期,现在直接调 deepseek-flash 即可。

思考模式怎么开

API 里两档默认开启思考模式、强度默认 high。OpenAI 格式用 thinking.type(enabled/disabled)开关、reasoning_effort(low/high/max)调强度;Anthropic 格式用 output_config.effort;Responses 格式用 reasoning.effort,传 none 即关闭。出于兼容,minimal 会映射为 low、medium 与 xhigh 映射为 high、ultra 映射为 max。思考模式下 temperaturepresence_penaltyfrequency_penalty 设了不报错但不生效,top_p 下限抬到 0.95。官方建议复杂 Agent 任务用 max。V4.1 Flash 模型卡另写明权重本身支持 1–100 的连续思考强度,但官方 API 只开放上面三档。

走 Anthropic 兼容口(https://api.deepseek.com/anthropic)接 Claude Code 时,官方做了模型名映射:claude-opus 开头的名字映射到 deepseek-v4-pro 并按 V4 Pro 价计费,claude-sonnet/claude-haiku 开头的映射到 deepseek-flash,不认识的名字也一律落到 deepseek-flash想用 Pro 却没显式指定,账单和效果都会是 Flash。

网页版和 App 里用的是哪个

按 8 月 13 日官方公告,网页端和 App 里选「专家模式」用的是 V4 Pro 正式版;9 月 10 日的 V4.1 Flash 公告只写了「已同步上线 API」,没提网页端与 App,快速模式此刻对应哪个模型官方未公示,本页不替它断言。网页版入口、登录方式和各模式的用法,见 DeepSeek网页版

开源权重与本地部署:Flash 能不能自己跑

两档权重都在 Hugging Face 的 deepseek-ai 组织下、许可证都是 MIT(可商用、无营收门槛),ModelScope 魔搭同步上架、大陆直连更快。体量(按 Hugging Face 仓库文件大小统计):V4.1 Flash 约 510 GBV4 Pro 0813 约 893 GB;已停 API 的旧版 V4-Flash-0731 约 167 GB,权重仍可下载。V4.1 Flash 的官方参考推理代码默认把权重转换成 8 卡张量并行、专家权重用 FP4,多机则用 torchrun 多节点启动;V4 Pro 0813 模型卡给的 vLLM 示例是单台 4×GB300 节点。官方在 V4.1 Flash 公告里还说,有大规模部署需求且具备「2k 卡 GPU、有存储集群」资源的可以直接联系他们。

换算成硬件(本站按权重体积估算,非官方要求):约 510 GB 的 V4.1 Flash 放进单台 8 卡 H200(8 × 141 GB = 1,128 GB)绰绰有余,剩余显存可给 KV 缓存;8 卡 80 GB 机型(合计 640 GB)只是勉强装下权重、留给并发与长上下文的余量很小,而且老一代卡能否跑 FP4 内核本页未核。V4.1 Flash 的长上下文很省显存:模型卡写明全局 KV 缓存每 token 约 890 字节,1M 上下文单条请求约 0.9 GB。约 893 GB 的 V4 Pro 则超过 8 卡 80 GB 机型总显存,至少要 8 卡 H200 这一级。

结论:个人电脑跑不动任何一档。消费级显卡单卡 24~32 GB,离 510 GB 差一个数量级;Ollama 官方库里的 deepseek-v4.1-flashdeepseek-v4-flashdeepseek-v4-pro 只有 :cloud 标签,拉下来实际是调 Ollama 的云端推理,不是在本机跑。所谓「DeepSeek V4 Flash 本地部署教程」若教你在普通电脑上装,多半是在装别的小模型。真想本地跑,按显存挑千问等小尺寸开源模型,对照表见 本地部署显卡选型