月之暗面(Moonshot AI)于 8 月 15 日发布了一项名为 PerceptionBench 的新基准测试,专门评估多模态 AI 模型的视觉感知能力,并将其与逻辑推理和外部知识分离。测试结果显示,包括 GPT-5.6 Sol、Kimi K3、Claude Fable 5 在内的 16 个前沿模型中,最高准确率仅为 59.7%,由 GPT-5.6 Sol 取得,无一模型突破 60% 大关。研究还发现,许多被归为“推理错误”的失败,其根源在于图像读取阶段的感知缺陷。
PerceptionBench 的设计思路与传统基准测试不同。它将视觉感知拆解为十个原子子技能,包括视觉关系、计数、属性、深度 3D、定位、比较、细粒度识别、上下文整合、OCR 和幻觉。每个问题仅凭观察图像即可回答,无需推理或外部知识。研究团队分析了 42 个开源基准测试,发现它们各自只覆盖了感知错误的一个狭窄子集,错误分布重叠度低,因此难以全面评估视觉感知能力。
为此,研究团队从真实模型错误出发,追溯每个错误在现有基准测试中的最早失败步骤,构建了上述分类体系。他们从内部超过 17,000 道验证题中筛选出 3,000 道任务发布,其中 60% 源自归因于模型的错误,40% 通过增强图像重新表述。这些任务看似简单,例如判断符号在钟面上的位置、数出红盒子里花的数量,或区分两个铅笔杯的颜色组合,但模型表现却普遍不佳。
在整体排名中,GPT-5.6 Sol 以 59.7% 的准确率居首,Kimi K3 以 58.5% 紧随其后,Claude Fable 5 为 57.2%,Gemini 3.1 Pro 为 56.2%,GPT-5.5 为 55.8%。开源模型如 Qwen3.5-397B-A17B(47.5%)和 GLM-4.6V(32.5%)则明显落后。值得注意的是,前五名系统之间的差距不到四个百分点,但类别层面的结果差异显著:总分相近的模型在个别类别上表现迥异。例如,幻觉类别平均是最弱项,GPT-5.6 Sol 在此仅得 26.9%,而较弱的 Gemini 3.5 Flash 反而以 50.6% 位列前茅。该子测试考察模型是否会凭空捏造不存在的物体,正确答案往往只是“零”。
研究作者指出,许多多模态模型的失败常被归咎于“推理错误”,但实际上在感知层面就已出错。当模型执行多步骤任务时,第一步——正确读取图像——往往已经失败。PerceptionBench 将这类任务拆解为仅涉及感知的子问题,从而能够定位具体是哪种视觉能力失效。数据集和评估代码已在 GitHub 上以 MoonshotAI/PerceptionBench 公开。
月之暗面是开源模型 Kimi K3 的开发者,该模型在通用基准测试上已缩小与 Claude Fable 5 和 GPT-5.6 Sol 的差距,但在进攻性网络安全和复杂数学等专业领域仍落后。在视觉感知方面,K3 现已与西方竞争对手持平。此前,该团队还发布了 WorldVQA 基准,将物体识别与推理分离,当时最佳模型 Gemini 3 Pro 的准确率仅为 47.4%,且所有模型都系统性高估了自身置信度。另一项由月之暗面参与的中国机构研究,使用 BabyVision 基准测试发现,前沿模型在追踪线条、数隐藏积木等与幼儿发展相关的基础视觉任务上表现不佳,Gemini 3 Pro 得分 49.7%,而人类高达 94.1%。研究人员将这一差距归因于“语言化瓶颈”——视觉信息在转化为语言时丢失了保真度。
PerceptionBench 的发布再次印证了此前研究的结论:即便是最先进的模型,在基础视觉任务上仍存在显著短板。对于依赖视觉输入的 AI 应用,如自动驾驶、具身智能和图像理解,这一瓶颈可能成为实际部署的关键制约。