DeepSeek 于 2 月 14 日在 Hugging Face 平台发布了其 V4 系列的首个多模态实验模型 DeepSeek-V4-Flash-Vision-Exp。该模型基于 DeepSeek-V4-Flash 架构,通过引入视觉模块并经历持续训练,解锁了视觉理解能力,参数规模达 305B,采用 MIT 许可 开放。
据模型卡介绍,与上一版本 DeepSeek-V4-Flash-0731 相比,新模型在多模态智能体能力上取得显著提升,同时在纯文本智能体任务上保持了相当的表现。官方公布的基准测试数据显示,在多模态智能体基准 ApexBench 上,新模型 Pass@1 得分 36.5,明显高于 V4-Flash-0731 的 26.2;在 Chartography 基准上得分 64.3,而 V4-Flash-0731 未参与该测试;在 ZeroBench 上 Pass@5 得分 35.0,V4-Flash-0731 同样未参与。值得注意的是,在纯文本智能体基准上,新模型与 V4-Flash-0731 互有胜负,例如在 Terminal Bench 上得分 83.9,略高于后者的 82.7,但在 Cybergym 上得分 75.3,略低于后者的 76.7。
该模型的发布延续了 DeepSeek 在开源大模型领域的激进策略。此前,DeepSeek 已推出 V4 系列的多款模型,而此次首次将视觉能力引入该系列,意味着其多模态能力正式进入 V4 时代。模型卡特别指出,在评估时,V4-Flash-0731 忽略了输入中的多模态元素,因此其在多模态基准上的表现可能未完全反映其潜力。
从技术实现看,该模型采用 MoE(混合专家) 架构,并集成了 Hyper-Connections 与 DSpark 前向路径。仓库提供了 tokenizer、提示编码参考以及最小 PyTorch 推理实现,涵盖视觉编码器、对齐器、DFlash 注意力等组件。开发者可通过 OpenAI 风格的 JSON 内容块或紧凑的图像路径 TXT 记号来构造提示,两种方式编码后得到相同的提示与 token ID。
对于 AI 产业而言,该模型的发布具有多重含义。一方面,它展示了 DeepSeek 在多模态智能体方向的进展,可能为应用层开发者提供更强大的开源工具,尤其在需要视觉理解与智能体交互的场景,如自动化测试、代码生成、图表分析等。另一方面,其开源策略与 MIT 许可可能进一步加剧开源模型与闭源模型之间的竞争,对依赖模型能力的下游应用与云服务生态产生潜在影响。
不过,作为实验性模型,其实际性能与稳定性仍需社区验证。模型卡中提及的基准测试结果,尤其是多模态智能体能力,是否能在真实场景中复现,尚待进一步观察。此外,该模型在纯文本任务上的表现与 V4-Flash-0731 相当,表明其定位更侧重于多模态能力的拓展,而非全面超越。
总体而言,DeepSeek-V4-Flash-Vision-Exp 的发布是 DeepSeek 在多模态领域的一次重要尝试,也为开源社区提供了新的选择。其后续迭代与生态支持值得关注。