月之暗面(Moonshot AI)於 8 月 15 日釋出了一項名為 PerceptionBench 的新基準測試,專門評估多模態 AI 模型的視覺感知能力,並將其與邏輯推理和外部知識分離。測試結果顯示,包括 GPT-5.6 Sol、Kimi K3、Claude Fable 5 在內的 16 個前沿模型中,最高準確率僅為 59.7%,由 GPT-5.6 Sol 取得,無一模型突破 60% 大關。研究還發現,許多被歸為“推理錯誤”的失敗,其根源在於影像讀取階段的感知缺陷。

PerceptionBench 的設計思路與傳統基準測試不同。它將視覺感知拆解為十個原子子技能,包括視覺關係、計數、屬性、深度 3D、定位、比較、細粒度識別、上下文整合、OCR 和幻覺。每個問題僅憑觀察影像即可回答,無需推理或外部知識。研究團隊分析了 42 個開源基準測試,發現它們各自只覆蓋了感知錯誤的一個狹窄子集,錯誤分佈重疊度低,因此難以全面評估視覺感知能力。

為此,研究團隊從真實模型錯誤出發,追溯每個錯誤在現有基準測試中的最早失敗步驟,構建了上述分類體系。他們從內部超過 17,000 道驗證題中篩選出 3,000 道任務釋出,其中 60% 源自歸因於模型的錯誤,40% 通過增強影像重新表述。這些任務看似簡單,例如判斷符號在鐘面上的位置、數出紅盒子裡花的數量,或區分兩個鉛筆杯的顏色組合,但模型表現卻普遍不佳。

在整體排名中,GPT-5.6 Sol59.7% 的準確率居首,Kimi K358.5% 緊隨其後,Claude Fable 557.2%Gemini 3.1 Pro56.2%GPT-5.555.8%開源模型Qwen3.5-397B-A17B47.5%)和 GLM-4.6V32.5%)則明顯落後。值得注意的是,前五名系統之間的差距不到四個百分點,但類別層面的結果差異顯著:總分相近的模型在個別類別上表現迥異。例如,幻覺類別平均是最弱項,GPT-5.6 Sol 在此僅得 26.9%,而較弱的 Gemini 3.5 Flash 反而以 50.6% 位列前茅。該子測試考察模型是否會憑空捏造不存在的物體,正確答案往往只是“零”。

研究作者指出,許多多模態模型的失敗常被歸咎於“推理錯誤”,但實際上在感知層面就已出錯。當模型執行多步驟任務時,第一步——正確讀取影像——往往已經失敗。PerceptionBench 將這類任務拆解為僅涉及感知的子問題,從而能夠定位具體是哪種視覺能力失效。資料集和評估程式碼已在 GitHub 上以 MoonshotAI/PerceptionBench 公開。

月之暗面是開源模型 Kimi K3 的開發者,該模型在通用基準測試上已縮小與 Claude Fable 5GPT-5.6 Sol 的差距,但在進攻性網路安全和複雜數學等專業領域仍落後。在視覺感知方面,K3 現已與西方競爭對手持平。此前,該團隊還發布了 WorldVQA 基準,將物體識別與推理分離,當時最佳模型 Gemini 3 Pro 的準確率僅為 47.4%,且所有模型都系統性高估了自身置信度。另一項由月之暗面參與的中國機構研究,使用 BabyVision 基準測試發現,前沿模型在追蹤線條、數隱藏積木等與幼兒發展相關的基礎視覺任務上表現不佳,Gemini 3 Pro 得分 49.7%,而人類高達 94.1%。研究人員將這一差距歸因於“語言化瓶頸”——視覺資訊在轉化為語言時丟失了保真度。

PerceptionBench 的釋出再次印證了此前研究的結論:即便是最先進的模型,在基礎視覺任務上仍存在顯著短板。對於依賴視覺輸入的 AI 應用,如自動駕駛、具身智慧和影像理解,這一瓶頸可能成為實際部署的關鍵制約。