8月21日,DeepSeek悄然上線了多模態視覺理解模型DeepSeek V4 Flash Vision Exp,官方僅給出效能表和幾個演示案例,既無技術報告也未開源。這一舉動與創始人梁文鋒此前“多模態不是主線”的表態形成微妙反差,被外界解讀為其產品策略的務實轉向。

梁文鋒曾在投資人交流會上明確表示,多模態對C端產品重要,但對智慧上限而言只是“元件”,並非主線,並預告V4後續版本將支援原生多模態。如今,DeepSeek V4 Flash Vision Exp的釋出,看似違背了“元件”定位——它更像一個主線模型,而非像DeepSeek OCR那樣純粹的輔助工具。然而,細看其評測基準,卻透露出DeepSeek的真實意圖:官方公佈的跑分集中在Terminal Bench 2.1(83.9分)和DeepSWE(59.3分)等Agent基準上,而非傳統視覺模型常用的MMMU、MathVista等“看圖答題”測試。這暗示該模型的核心價值在於讓Agent看懂網頁截圖、圖表和UI佈局,從而完成任務,而非單純的多模態對話。

事實上,DeepSeek在多模態技術上的積累早有鋪墊。4月29日,其多模態負責人陳小康在X平台預告灰度測試,次日DeepSeek釋出技術報告《Thinking with Visual Primitives》,提出將點座標和邊界框作為“思維的最小單元”嵌入推理鏈,實現“邊推理邊指向”。該論文雖在5月1日被撤下,但6月上線的Vision模式已採用此機制,而DeepSeek V4 Flash Vision Exp正是將同一技術嫁接到V4-Flash API基座上,重點強化多模態Agent能力。

此次釋出的另一背景是DeepSeek主力產品DSH(DeepSeek Harness)的迭代。8月19日,DSH更新rc.8版本,提升Agent多模態能力,採用“原生直通”和“工具層視覺”兩條腿走路:前者讓支援視覺輸入的底層模型直接處理圖片,後者則為純文本模型提供OCR等降級方案。此前,DSH依賴社群外掛或外部視覺模型“借眼睛”,如今終於有了自家視覺模型支撐。

梁文鋒的產品哲學曾是“不完美不釋出”,DeepSeek V4從預覽到正式版歷經數月跳票,V3.2與V4預覽版相隔4個半月。但此次實驗性模型的快速上線,以及DSH的頻繁更新,顯示其態度已發生轉變——放低姿態,用產品與使用者更密切交流。社群實測卻顯示,該模型連梁文鋒本人的代表性照片都無法識別,複雜圖表理解也漏掉關鍵資訊,中文場景偏弱,引發“效果一般”的普遍評價。

這一動作背後,是DeepSeek面臨的競爭壓力。國際對手OpenAI於8月20日開源Codex Harness,將多模態置於Agent執行時核心,模型可直接接收截圖並納入任務鏈,減少資訊損耗。Anthropic的Claude Code因靜默期暫無大更新,但OpenAI的激進策略顯然刺激了DeepSeek。梁文鋒急於告訴使用者“別人有的我們也有”,儘管仍需時間完善。

社群正在補足DSH的“最後一公里”,例如大二學生Benson Wang開發的DSH Desktop專案,實現一鍵安裝,降低普通使用者使用門檻。DeepSeek V4 Flash Vision Exp的釋出,既是技術路線的延續,也是產品策略的調整——多模態不是目的,而是強化Agent與推理主線的外掛。對於AI產業觀察者而言,這一事件表明DeepSeek正加速補齊多模態能力,以應對日益激烈的模型層競爭,其後續正式版能否兌現潛力,值得持續關注。