DeepSeek 於近日在官方 API 平台正式上線新一代多模態模型 DeepSeek-V4-Flash-Vision-Exp。據官方介紹,該模型在文本能力上與 DeepSeek-V4-Flash 持平,覆蓋 agent、推理和世界知識等多個領域,但在多模態智慧體基準測試中實現了“重大躍升”,使多模態智慧體效能接近 Opus-4.8 的水平。

此次釋出的模型屬於實驗版本(Exp),延續了 DeepSeek 快速迭代的風格。從命名看,V4-Flash-Vision-Exp 定位為 V4 系列的輕量級多模態版本,旨在兼顧效能與效率。文本能力與 V4-Flash 持平,意味著其在語言理解和生成上保持了既有水準,而多模態能力的增強則補齊了視覺理解等短板,這對於需要處理影像、影片等非文本資訊的 agent 應用尤為重要。

多模態智慧體是當前 AI 應用的熱點方向,從智慧客服到具身智慧,都需要模型具備跨模態的理解與決策能力。DeepSeek 此次將多模態效能提升至接近 Opus-4.8 的水平,而 Opus 系列在業界以強大綜合能力著稱,這顯示出 DeepSeek 在多模態領域的技術追趕速度。對於開發者而言,通過 API 即可呼叫新模型,降低了構建多模態應用的門檻。

不過,目前官方並未公佈具體的基準測試分數或對比細節,僅以“接近”描述相對水平。實際效果仍需開發者實測驗證。對於 AI 產業投資者而言,模型能力的快速迭代將影響下游應用的成本與效果,也可能改變模型市場的競爭格局。DeepSeek 的持續投入,有望推動多模態應用生態的繁榮,但具體商業落地效果尚待觀察。