DeepSeek在千呼萬喚中推出了視覺理解模型DeepSeek-V4-Flash-Vision-Exp,正式補齊多模態能力。該模型原生支援圖片輸入,可識別影像、讀取截圖和圖表。價格延續DeepSeek一貫的低價策略,一張圖片最多折算384個輸入Token,即使在高峰期,一分錢也能讓模型分析8張圖片。然而,使用者實測反饋卻與官方跑分形成鮮明對比,不少評價直指“效果一般”。
官方資料顯示,Vision-Exp保留了V4-Flash的Agent、推理和世界知識能力,在視覺理解的Agent Benchmark上,其多模態Agent成績已接近Anthropic的旗艦模型Opus 4.8。但網友實測中,模型在識人環節頻頻翻車:有使用者將梁文鋒的照片發給模型,它卻將其識別為美團創始人王興,換張照片又認成字節跳動創始人張一鳴。更有甚者,面對時代少年團的合照,模型竟因五人“皮膚過於光滑、提包有AI感”而判斷這是批次生成的假圖,懷疑其真實性。
在更貼近開發者工作的複雜任務中,Vision-Exp也暴露出不足。有網友要求其生成Three.js三維場景,成品完整度雖略優於Gemini 3.7 Flash,但執行過程中反覆自我糾錯、多次斷聯,完成同一任務消耗的Token高出近15倍,耗時多出3.5倍。
為驗證實際表現,媒體使用DeepSeek Harness進行了多輪測試。在識人測試中,給出一張包含梁文鋒、馬斯克和奧爾特曼的AI合成梗圖,Vision-Exp成功認出梁文鋒和馬斯克,並推測圖片在調侃DeepSeek對美國AI行業的衝擊,但未能識別出奧爾特曼,將其判斷為“AI生成的陪襯”,也未理解圖片復刻的2024年7月特朗普遇刺後高舉拳頭的名場面。相比之下,豆包能認出全部三人。在景物識別上,Vision-Exp表現不錯,能準確描述成都安順廊橋的時間、光線和空間關係,甚至能介紹其歷史。
在復刻網頁的任務中,媒體要求模型根據幻方量化官網“算力隨時待命”頁面截圖生成程式碼。Vision-Exp搭建出了整體框架,但色塊邊緣、小圖示被簡化,部分文字位置錯亂,距離“一比一復刻”有差距。對比測試中,GLM-5.3生成的頁面觀感更完整,流程圖層級清晰,文字位置準確;Kimi K3不僅還原結構,還實現了色塊漸變和發光效果,層次更接近原圖。
儘管Vision-Exp存在明顯不足,但DeepSeek似乎有意將其作為實驗版釋出。模型名稱字尾“Exp”已表明其未完全打磨。選擇基於V4-Flash(總引數284B,啟用引數13B)而非V4-Pro(總引數1.6T,啟用引數49B),可能是為了控制圖片輸入帶來的額外成本,便於開發者大量測試。這種“先放實驗版、收集問題、再出正式版”的策略,DeepSeek此前已有先例——2025年9月推出V3.2-Exp驗證DSA稀疏注意力機制,兩個多月後才釋出正式版。
Vision-Exp並未取代V4-Flash,純文本任務使用者仍可繼續使用舊模型,開發者則可主動切換體驗多模態。這種並行策略既不影響穩定服務,又能開放試驗。不過,認錯創始人、將真人當AI、看不懂梗圖等問題,也說明DeepSeek在多模態領域仍有較大提升空間。隨著正式版釋出,使用者或許不會再如此寬容,梁文鋒的“滑動變阻器”最終會停在何處,值得持續關注。