DeepSeek V4 Pro 是深度求索 V4 系列的旗艦檔,DeepSeek V4.1 Flash 是 2026 年 9 月 10 日釋出的新一代小尺寸模型。截至 2026 年 9 月 14 日,兩者在官方 API 上並行在售:V4 Pro 的模型名是 deepseek-v4-pro(總引數 1.6T、每 token 啟用 49B),V4.1 Flash 的模型名是 deepseek-flash(552B 主幹引數、輸入啟用 8B/輸出啟用 16B)。兩檔上下文都是 1M、最大輸出 384K,權重都以 MIT 許可開源。一句話區別:V4.1 Flash 更便宜、更快、Agent 程式設計跑分更高,還能看圖;V4 Pro 世界知識更紮實、純推理題和長文本題分數更高。
DeepSeek V4 Pro 和 V4.1 Flash 的區別
定位:V4 Pro 是 V4 一代(4 月 24 日釋出)的大號旗艦;V4.1 Flash 是官方口中「全新模型結構系列中的最小尺寸」,結構換成了 Causal-Encoder-Decoder,不是 V4 Pro 的縮小版或蒸餾版。
引數:V4 Pro 為 MoE,總參 1.6T、啟用 49B;V4.1 Flash 為 MoE,主幹 552B,讀輸入(prefill)時每 token 啟用 8B、生成輸出(decode)時啟用 16B,另帶 196B 引數的 Engram 條件記憶模組(按 token 查表稀疏訪問)。Hugging Face 頁面按張量統計顯示約 763B,與官方 552B 的主幹口徑不同,別混用。
能力(官方自測,max 思考檔):按 V4.1 Flash 模型卡的對照表,Agent 與程式設計類 V4.1 Flash 全面領先——Terminal-Bench 2.1 90.6 對 87.9、DeepSWE v1.1 74.2 對 62.7、Terminal-Bench 4.0 31.2 對 12.4、Codeforces 3471 對 3348;但純推理與知識題 V4 Pro 仍佔上風——HLE 42.7 對 36.8、GPQA Diamond 92.4 對 90.9。基座模型對比裡,V4 Pro 在 SimpleQA-Verified(55.2 對 42.3)和長文本 LongBench-V2(51.5 對 45.2)上明顯更強。所以官方公告說 V4.1 Flash「全面超越 V4 Pro」,指的是效能、費用、速度、總用時這組綜合指標,不等於每一項跑分都贏。
速度:第三方評測機構 Artificial Analysis 實測(Intelligence Index v4.3 口徑,均為最高思考檔):V4.1 Flash 輸出約 214 token/秒、首 token 1.17 秒、綜合指數 40;V4 Pro 0813 輸出約 78 token/秒、首 token 1.67 秒、綜合指數 36。實測速度隨服務商和時段波動,只看量級。
價格:同一時段下,V4 Pro 的未命中輸入價是 V4.1 Flash 的 4.5 倍、輸出價約 3.4 倍、快取命中輸入價 7.5 倍。按高峰價粗算,100 萬輸入(未命中)加 100 萬輸出,V4.1 Flash 約 ¥10、V4 Pro 約 ¥36。
功能:兩檔都支援思考/非思考切換、JSON Output、Tool Calls、Responses API、Anthropic API、對話字首續寫,FIM 補全都只在非思考模式可用;影像理解只有 V4.1 Flash 支援,V4 Pro 在 API 側不支援。併發上限 V4.1 Flash 2500、V4 Pro 500。
怎麼選:跑 Claude Code、OpenCode 這類程式設計 Agent、批次長任務、需要看截圖和圖表,優先 V4.1 Flash;問答裡對事實準確度要求高(冷門知識、專業百科)、或者已有流程在 V4 Pro 上調好了提示詞,繼續用 V4 Pro。拿不準就兩檔各跑一遍自己的樣例再定,官方也保留了兩個模型名。
正式版時間線:從預覽版到 V4.1 Flash
2026-04-24:V4 預覽版釋出並開源,分 V4-Pro 與 V4-Flash 兩檔,1M 上下文成為官方服務標配;舊模型名 deepseek-chat/deepseek-reasoner 指向 V4-Flash,並於 7 月 24 日停用。2026-07-31:V4-Flash 正式版(0731)API 公測,結構與預覽版一致、只重做了後訓練,當時官方註明網頁端與 App 未改。2026-08-13:V4 Pro 正式版(0813)在 App、網頁端和 API 同步上線,API 模型名不變,同時原生支援 Responses API、思考強度改為 low/high/max 三檔,並宣佈峰谷定價於 8 月 17 日 0 時生效。2026-08-21:多模態實驗模型 V4-Flash-Vision-Exp 上線 API。
2026-09-10:V4.1 Flash 釋出,新價當天 12:00 生效;舊的 V4 Flash 與 V4 Flash Vision Exp 下線,兩個舊名暫時路由到 V4.1 Flash、按 Flash 價計費。公告原本還寫著「北京時間 9 月 14 日 12:00 之後、V4.1 Pro 上線之前,deepseek-v4-pro 的請求全部路由到 V4.1 Flash」——但官方隨後改口,更新日誌與定價頁腳註現寫明:「為響應廣大使用者的需求,我們決定在 2026 年 9 月 14 日之後繼續提供 DeepSeek V4 Pro 的 API 呼叫服務,計費方式保持不變」。所以並檔沒有發生,V4 Pro 正式版仍在售;官方同時說了「如有變動,我們將另行通知」。
搜尋裡常見的 expires-on-0910:據部落格園一篇技術博文,9 月 8 日起官方曾限時開放內測模型名 deepseek-v4.1-flash-expires-on-0910(每賬號 20 併發、按 V4 Flash 價計費、9 月 10 日自動過期)。官方更新日誌沒有收錄這一條,本頁未能在官方文件核實;無論如何它已過期,現在直接調 deepseek-flash 即可。
思考模式怎麼開
API 裡兩檔預設開啟思考模式、強度預設 high。OpenAI 格式用 thinking.type(enabled/disabled)開關、reasoning_effort(low/high/max)調強度;Anthropic 格式用 output_config.effort;Responses 格式用 reasoning.effort,傳 none 即關閉。出於相容,minimal 會對映為 low、medium 與 xhigh 對映為 high、ultra 對映為 max。思考模式下 temperature、presence_penalty、frequency_penalty 設了不報錯但不生效,top_p 下限抬到 0.95。官方建議複雜 Agent 任務用 max。V4.1 Flash 模型卡另寫明權重本身支援 1–100 的連續思考強度,但官方 API 只開放上面三檔。
走 Anthropic 相容口(https://api.deepseek.com/anthropic)接 Claude Code 時,官方做了模型名對映:claude-opus 開頭的名字對映到 deepseek-v4-pro 並按 V4 Pro 價計費,claude-sonnet/claude-haiku 開頭的對映到 deepseek-flash,不認識的名字也一律落到 deepseek-flash。想用 Pro 卻沒顯式指定,賬單和效果都會是 Flash。
網頁版和 App 裡用的是哪個
按 8 月 13 日官方公告,網頁端和 App 裡選「專家模式」用的是 V4 Pro 正式版;9 月 10 日的 V4.1 Flash 公告只寫了「已同步上線 API」,沒提網頁端與 App,快速模式此刻對應哪個模型官方未公示,本頁不替它斷言。網頁版入口、登入方式和各模式的用法,見 DeepSeek網頁版。
開源權重與本地部署:Flash 能不能自己跑
兩檔權重都在 Hugging Face 的 deepseek-ai 組織下、許可證都是 MIT(可商用、無營收門檻),ModelScope 魔搭同步上架、大陸直連更快。體量(按 Hugging Face 倉庫檔案大小統計):V4.1 Flash 約 510 GB、V4 Pro 0813 約 893 GB;已停 API 的舊版 V4-Flash-0731 約 167 GB,權重仍可下載。V4.1 Flash 的官方參考推理程式碼預設把權重轉換成 8 卡張量並行、專家權重用 FP4,多機則用 torchrun 多節點啟動;V4 Pro 0813 模型卡給的 vLLM 示例是單台 4×GB300 節點。官方在 V4.1 Flash 公告裡還說,有大規模部署需求且具備「2k 卡 GPU、有儲存叢集」資源的可以直接聯絡他們。
換算成硬體(本站按權重體積估算,非官方要求):約 510 GB 的 V4.1 Flash 放進單台 8 卡 H200(8 × 141 GB = 1,128 GB)綽綽有餘,剩餘視訊記憶體可給 KV 快取;8 卡 80 GB 機型(合計 640 GB)只是勉強裝下權重、留給併發與長上下文的餘量很小,而且老一代卡能否跑 FP4 核心本頁未核。V4.1 Flash 的長上下文很省視訊記憶體:模型卡寫明全域性 KV 快取每 token 約 890 位元組,1M 上下文單條請求約 0.9 GB。約 893 GB 的 V4 Pro 則超過 8 卡 80 GB 機型總視訊記憶體,至少要 8 卡 H200 這一級。
結論:個人電腦跑不動任何一檔。消費級顯示卡單卡 24~32 GB,離 510 GB 差一個數量級;Ollama 官方庫裡的 deepseek-v4.1-flash、deepseek-v4-flash、deepseek-v4-pro 只有 :cloud 標籤,拉下來實際是調 Ollama 的雲端推理,不是在本機跑。所謂「DeepSeek V4 Flash 本地部署教程」若教你在普通電腦上裝,多半是在裝別的小模型。真想本地跑,按視訊記憶體挑千問等小尺寸開源模型,對照表見 本地部署顯示卡選型。