中國人工智慧公司 DeepSeek 於 2026 年 8 月 21 日宣佈推出實驗性多模態模型 V4-Flash-Vision-Exp,該模型在視覺理解任務上對標美國競爭對手 Anthropic 的高階產品 Claude Opus 4.8。據綜合港媒報道,DeepSeek 表示,這一新工具的效能已接近 Anthropic 的旗艦模型,標誌著其在多模態 AI 領域的重要進展。
V4-Flash-Vision-Exp 是 DeepSeek 旗艦純文本模型 V4-Flash 的實驗版本,新增了影像和螢幕截圖等視覺提示的理解與行動能力。DeepSeek 官方稱,該模型在純文本能力(包括 Agent、推理、世界知識等)上與 V4-Flash 正式版持平,而在需要視覺理解的 Agent 基準測試中,其效能相比 V4-Flash 實現了大幅躍升,多模態 Agent 能力已接近 Anthropic 的 Claude Opus 4.8。
此前,DeepSeek 已釋出過 DeepSeek-VL 系列等多模態和視覺模型,但 V4-Flash-Vision-Exp 是首次為其最先進的模型系列(V4 系列)增加影像理解和執行任務的能力。使用者現在可以通過 DeepSeek 的 API 使用該模型,API 支援 Chat Completions、Messages、Responses 三種格式呼叫,方便接入各類 Agent 工具,並支援圖文混合輸入,以及 base64 內聯、外部 URL、Files API 三種圖片傳入方式。
這一發布正值全球 AI 競爭加劇之際,多模態能力被視為 AI 模型從文本處理邁向更復雜應用的關鍵一步。Anthropic 的 Claude Opus 4.8 是市場上公認的高效能模型之一,DeepSeek 此次對標該產品,顯示出其在技術追趕上的雄心。對於 AI 產業鏈而言,多模態模型的進步可能帶動對影像處理、邊緣計算等相關算力的需求,並影響模型層競爭格局。
值得注意的是,V4-Flash-Vision-Exp 目前仍是實驗性版本,其實際效能與穩定性尚待進一步驗證。DeepSeek 選擇以實驗版形式釋出,或意在收集使用者反饋並快速迭代。市場觀察人士認為,這一舉動可能加劇中國與美國在 AI 模型領域的競爭,同時也為開發者提供了更多選擇。
總體而言,DeepSeek 此次推出的視覺理解模型,不僅豐富了其產品線,也展示了其在多模態 AI 領域的技術積累。未來,隨著實驗版本的成熟,其應用場景有望擴充套件至更多領域,如智慧助手、內容稽核、自動駕駛等。對於關注 AI 產業的投資者而言,多模態模型的進展值得持續跟蹤,因為它可能預示著 AI 應用邊界的進一步拓展。