8月21日,DeepSeek悄然上线了多模态视觉理解模型DeepSeek V4 Flash Vision Exp,官方仅给出性能表和几个演示案例,既无技术报告也未开源。这一举动与创始人梁文锋此前“多模态不是主线”的表态形成微妙反差,被外界解读为其产品策略的务实转向。
梁文锋曾在投资人交流会上明确表示,多模态对C端产品重要,但对智能上限而言只是“组件”,并非主线,并预告V4后续版本将支持原生多模态。如今,DeepSeek V4 Flash Vision Exp的发布,看似违背了“组件”定位——它更像一个主线模型,而非像DeepSeek OCR那样纯粹的辅助工具。然而,细看其评测基准,却透露出DeepSeek的真实意图:官方公布的跑分集中在Terminal Bench 2.1(83.9分)和DeepSWE(59.3分)等Agent基准上,而非传统视觉模型常用的MMMU、MathVista等“看图答题”测试。这暗示该模型的核心价值在于让Agent看懂网页截图、图表和UI布局,从而完成任务,而非单纯的多模态对话。
事实上,DeepSeek在多模态技术上的积累早有铺垫。4月29日,其多模态负责人陈小康在X平台预告灰度测试,次日DeepSeek发布技术报告《Thinking with Visual Primitives》,提出将点坐标和边界框作为“思维的最小单元”嵌入推理链,实现“边推理边指向”。该论文虽在5月1日被撤下,但6月上线的Vision模式已采用此机制,而DeepSeek V4 Flash Vision Exp正是将同一技术嫁接到V4-Flash API基座上,重点强化多模态Agent能力。
此次发布的另一背景是DeepSeek主力产品DSH(DeepSeek Harness)的迭代。8月19日,DSH更新rc.8版本,提升Agent多模态能力,采用“原生直通”和“工具层视觉”两条腿走路:前者让支持视觉输入的底层模型直接处理图片,后者则为纯文本模型提供OCR等降级方案。此前,DSH依赖社区插件或外部视觉模型“借眼睛”,如今终于有了自家视觉模型支撑。
梁文锋的产品哲学曾是“不完美不发布”,DeepSeek V4从预览到正式版历经数月跳票,V3.2与V4预览版相隔4个半月。但此次实验性模型的快速上线,以及DSH的频繁更新,显示其态度已发生转变——放低姿态,用产品与用户更密切交流。社区实测却显示,该模型连梁文锋本人的代表性照片都无法识别,复杂图表理解也漏掉关键信息,中文场景偏弱,引发“效果一般”的普遍评价。
这一动作背后,是DeepSeek面临的竞争压力。国际对手OpenAI于8月20日开源Codex Harness,将多模态置于Agent运行时核心,模型可直接接收截图并纳入任务链,减少信息损耗。Anthropic的Claude Code因静默期暂无大更新,但OpenAI的激进策略显然刺激了DeepSeek。梁文锋急于告诉用户“别人有的我们也有”,尽管仍需时间完善。
社区正在补足DSH的“最后一公里”,例如大二学生Benson Wang开发的DSH Desktop项目,实现一键安装,降低普通用户使用门槛。DeepSeek V4 Flash Vision Exp的发布,既是技术路线的延续,也是产品策略的调整——多模态不是目的,而是强化Agent与推理主线的插件。对于AI产业观察者而言,这一事件表明DeepSeek正加速补齐多模态能力,以应对日益激烈的模型层竞争,其后续正式版能否兑现潜力,值得持续关注。