DeepSeek在千呼万唤中推出了视觉理解模型DeepSeek-V4-Flash-Vision-Exp,正式补齐多模态能力。该模型原生支持图片输入,可识别图像、读取截图和图表。价格延续DeepSeek一贯的低价策略,一张图片最多折算384个输入Token,即使在高峰期,一分钱也能让模型分析8张图片。然而,用户实测反馈却与官方跑分形成鲜明对比,不少评价直指“效果一般”。

官方数据显示,Vision-Exp保留了V4-Flash的Agent、推理和世界知识能力,在视觉理解的Agent Benchmark上,其多模态Agent成绩已接近Anthropic的旗舰模型Opus 4.8。但网友实测中,模型在识人环节频频翻车:有用户将梁文锋的照片发给模型,它却将其识别为美团创始人王兴,换张照片又认成字节跳动创始人张一鸣。更有甚者,面对时代少年团的合照,模型竟因五人“皮肤过于光滑、提包有AI感”而判断这是批量生成的假图,怀疑其真实性。

在更贴近开发者工作的复杂任务中,Vision-Exp也暴露出不足。有网友要求其生成Three.js三维场景,成品完整度虽略优于Gemini 3.7 Flash,但执行过程中反复自我纠错、多次断联,完成同一任务消耗的Token高出近15倍,耗时多出3.5倍

为验证实际表现,媒体使用DeepSeek Harness进行了多轮测试。在识人测试中,给出一张包含梁文锋、马斯克和奥尔特曼的AI合成梗图,Vision-Exp成功认出梁文锋和马斯克,并推测图片在调侃DeepSeek对美国AI行业的冲击,但未能识别出奥尔特曼,将其判断为“AI生成的陪衬”,也未理解图片复刻的2024年7月特朗普遇刺后高举拳头的名场面。相比之下,豆包能认出全部三人。在景物识别上,Vision-Exp表现不错,能准确描述成都安顺廊桥的时间、光线和空间关系,甚至能介绍其历史。

在复刻网页的任务中,媒体要求模型根据幻方量化官网“算力随时待命”页面截图生成代码。Vision-Exp搭建出了整体框架,但色块边缘、小图标被简化,部分文字位置错乱,距离“一比一复刻”有差距。对比测试中,GLM-5.3生成的页面观感更完整,流程图层级清晰,文字位置准确;Kimi K3不仅还原结构,还实现了色块渐变和发光效果,层次更接近原图。

尽管Vision-Exp存在明显不足,但DeepSeek似乎有意将其作为实验版发布。模型名称后缀“Exp”已表明其未完全打磨。选择基于V4-Flash(总参数284B,激活参数13B)而非V4-Pro(总参数1.6T,激活参数49B),可能是为了控制图片输入带来的额外成本,便于开发者大量测试。这种“先放实验版、收集问题、再出正式版”的策略,DeepSeek此前已有先例——2025年9月推出V3.2-Exp验证DSA稀疏注意力机制,两个多月后才发布正式版。

Vision-Exp并未取代V4-Flash,纯文本任务用户仍可继续使用旧模型,开发者则可主动切换体验多模态。这种并行策略既不影响稳定服务,又能开放试验。不过,认错创始人、将真人当AI、看不懂梗图等问题,也说明DeepSeek在多模态领域仍有较大提升空间。随着正式版发布,用户或许不会再如此宽容,梁文锋的“滑动变阻器”最终会停在何处,值得持续关注。