中国人工智能公司 DeepSeek 于 2026 年 8 月 21 日宣布推出实验性多模态模型 V4-Flash-Vision-Exp,该模型在视觉理解任务上对标美国竞争对手 Anthropic 的高端产品 Claude Opus 4.8。据综合港媒报道,DeepSeek 表示,这一新工具的性能已接近 Anthropic 的旗舰模型,标志着其在多模态 AI 领域的重要进展。
V4-Flash-Vision-Exp 是 DeepSeek 旗舰纯文本模型 V4-Flash 的实验版本,新增了图像和屏幕截图等视觉提示的理解与行动能力。DeepSeek 官方称,该模型在纯文本能力(包括 Agent、推理、世界知识等)上与 V4-Flash 正式版持平,而在需要视觉理解的 Agent 基准测试中,其性能相比 V4-Flash 实现了大幅跃升,多模态 Agent 能力已接近 Anthropic 的 Claude Opus 4.8。
此前,DeepSeek 已发布过 DeepSeek-VL 系列等多模态和视觉模型,但 V4-Flash-Vision-Exp 是首次为其最先进的模型系列(V4 系列)增加图像理解和执行任务的能力。用户现在可以通过 DeepSeek 的 API 使用该模型,API 支持 Chat Completions、Messages、Responses 三种格式调用,方便接入各类 Agent 工具,并支持图文混合输入,以及 base64 内联、外部 URL、Files API 三种图片传入方式。
这一发布正值全球 AI 竞争加剧之际,多模态能力被视为 AI 模型从文本处理迈向更复杂应用的关键一步。Anthropic 的 Claude Opus 4.8 是市场上公认的高性能模型之一,DeepSeek 此次对标该产品,显示出其在技术追赶上的雄心。对于 AI 产业链而言,多模态模型的进步可能带动对图像处理、边缘计算等相关算力的需求,并影响模型层竞争格局。
值得注意的是,V4-Flash-Vision-Exp 目前仍是实验性版本,其实际性能与稳定性尚待进一步验证。DeepSeek 选择以实验版形式发布,或意在收集用户反馈并快速迭代。市场观察人士认为,这一举动可能加剧中国与美国在 AI 模型领域的竞争,同时也为开发者提供了更多选择。
总体而言,DeepSeek 此次推出的视觉理解模型,不仅丰富了其产品线,也展示了其在多模态 AI 领域的技术积累。未来,随着实验版本的成熟,其应用场景有望扩展至更多领域,如智能助手、内容审核、自动驾驶等。对于关注 AI 产业的投资者而言,多模态模型的进展值得持续跟踪,因为它可能预示着 AI 应用边界的进一步拓展。