DeepSeek 于近日在官方 API 平台正式上线新一代多模态模型 DeepSeek-V4-Flash-Vision-Exp。据官方介绍,该模型在文本能力上与 DeepSeek-V4-Flash 持平,覆盖 agent、推理和世界知识等多个领域,但在多模态智能体基准测试中实现了“重大跃升”,使多模态智能体性能接近 Opus-4.8 的水平。

此次发布的模型属于实验版本(Exp),延续了 DeepSeek 快速迭代的风格。从命名看,V4-Flash-Vision-Exp 定位为 V4 系列的轻量级多模态版本,旨在兼顾性能与效率。文本能力与 V4-Flash 持平,意味着其在语言理解和生成上保持了既有水准,而多模态能力的增强则补齐了视觉理解等短板,这对于需要处理图像、视频等非文本信息的 agent 应用尤为重要。

多模态智能体是当前 AI 应用的热点方向,从智能客服到具身智能,都需要模型具备跨模态的理解与决策能力。DeepSeek 此次将多模态性能提升至接近 Opus-4.8 的水平,而 Opus 系列在业界以强大综合能力著称,这显示出 DeepSeek 在多模态领域的技术追赶速度。对于开发者而言,通过 API 即可调用新模型,降低了构建多模态应用的门槛。

不过,目前官方并未公布具体的基准测试分数或对比细节,仅以“接近”描述相对水平。实际效果仍需开发者实测验证。对于 AI 产业投资者而言,模型能力的快速迭代将影响下游应用的成本与效果,也可能改变模型市场的竞争格局。DeepSeek 的持续投入,有望推动多模态应用生态的繁荣,但具体商业落地效果尚待观察。