DeepSeek 於 2 月 14 日在 Hugging Face 平台釋出了其 V4 系列的首個多模態實驗模型 DeepSeek-V4-Flash-Vision-Exp。該模型基於 DeepSeek-V4-Flash 架構,通過引入視覺模組並經歷持續訓練,解鎖了視覺理解能力,引數規模達 305B,採用 MIT 許可 開放。
據模型卡介紹,與上一版本 DeepSeek-V4-Flash-0731 相比,新模型在多模態智慧體能力上取得顯著提升,同時在純文本智慧體任務上保持了相當的表現。官方公佈的基準測試資料顯示,在多模態智慧體基準 ApexBench 上,新模型 Pass@1 得分 36.5,明顯高於 V4-Flash-0731 的 26.2;在 Chartography 基準上得分 64.3,而 V4-Flash-0731 未參與該測試;在 ZeroBench 上 Pass@5 得分 35.0,V4-Flash-0731 同樣未參與。值得注意的是,在純文本智慧體基準上,新模型與 V4-Flash-0731 互有勝負,例如在 Terminal Bench 上得分 83.9,略高於後者的 82.7,但在 Cybergym 上得分 75.3,略低於後者的 76.7。
該模型的釋出延續了 DeepSeek 在開源大模型領域的激進策略。此前,DeepSeek 已推出 V4 系列的多款模型,而此次首次將視覺能力引入該系列,意味著其多模態能力正式進入 V4 時代。模型卡特別指出,在評估時,V4-Flash-0731 忽略了輸入中的多模態元素,因此其在多模態基準上的表現可能未完全反映其潛力。
從技術實現看,該模型採用 MoE(混合專家) 架構,並集成了 Hyper-Connections 與 DSpark 前向路徑。倉庫提供了 tokenizer、提示編碼參考以及最小 PyTorch 推理實現,涵蓋視覺編碼器、對齊器、DFlash 注意力等元件。開發者可通過 OpenAI 風格的 JSON 內容塊或緊湊的影像路徑 TXT 記號來構造提示,兩種方式編碼後得到相同的提示與 token ID。
對於 AI 產業而言,該模型的釋出具有多重含義。一方面,它展示了 DeepSeek 在多模態智慧體方向的進展,可能為應用層開發者提供更強大的開源工具,尤其在需要視覺理解與智慧體互動的場景,如自動化測試、程式碼生成、圖表分析等。另一方面,其開源策略與 MIT 許可可能進一步加劇開源模型與閉源模型之間的競爭,對依賴模型能力的下游應用與雲服務生態產生潛在影響。
不過,作為實驗性模型,其實際效能與穩定性仍需社群驗證。模型卡中提及的基準測試結果,尤其是多模態智慧體能力,是否能在真實場景中復現,尚待進一步觀察。此外,該模型在純文本任務上的表現與 V4-Flash-0731 相當,表明其定位更側重於多模態能力的拓展,而非全面超越。
總體而言,DeepSeek-V4-Flash-Vision-Exp 的釋出是 DeepSeek 在多模態領域的一次重要嘗試,也為開源社群提供了新的選擇。其後續迭代與生態支援值得關注。