微軟近日在 Hugging Face 平台釋出了 Mage-VL,一款面向影像與影片理解的流式多模態基礎模型。該模型的核心創新在於其視覺編碼器 Mage-ViT 完全從零訓練,規模為 4B 引數,而非依賴常見的預訓練視覺 Transformer(ViT)。這一設計旨在解決當前視覺語言模型(VLM)在即時流式感知上的效率瓶頸:許多模型擅長複雜的離線推理,但在處理簡單、即時的流式輸入時卻顯得緩慢且計算密集。
Mage-VL 借鑑了現代影片編解碼器的結構,將影片流分解為錨定幀(I 幀)和預測幀(P 幀)。它保留所有錨定幀的 patch,並僅保留預測幀中編解碼器分配較多位元的區域——即包含真實運動和新細節的部分。這種與編解碼器對齊的稀疏化方法,可將視覺 token 的消耗減少 超過 75%,同時保持時空上下文,相比均勻幀取樣,推理速度可提升 最多 3.5 倍(以牆鍾時間計)。
在架構上,Mage-VL 由兩個主要元件構成:Mage-ViT 視覺編碼器和 Qwen3-4B 語言骨幹。Mage-ViT 在共享的 16×16 patch 網格上,根據編解碼器匯出的時空重要性分配 token,並採用 3D 旋轉位置編碼。它支援多種編解碼器輸入,包括傳統的 H.264/AVC、HEVC/H.265(通過運動向量和殘差能量),以及神經編解碼器 DCVC-RT(通過其學習的速率圖),且無需改變架構或重新訓練。語言骨幹則採用 Qwen3-4B-Instruct-2507,通過一個輕量級的兩層 MLP 投影器消費 Mage-ViT 的可變長度 token 流,統一處理影像、短/長/超長影片及流式輸入。
此外,Mage-VL 採用了一種「系統 1 / 系統 2」的雙過程設計,在單一模型內實現主動流式處理。一個輕量級的認知門(系統 1)監控每個滾動編解碼器視窗,對常規內容保持靜默,僅在檢測到值得響應的事件完成時,才呼叫完整的 VLM(系統 2)進行響應,無需多智慧體流水線。
在效能方面,Mage-VL 在多個基準測試上表現出色。在靜態影像理解上,它與 Qwen3-VL-4B 相當;在影片理解與空間智慧方面則明顯領先,例如在 VSI-Bench 上提升 +11.0,在 CrossPoint 上提升 +53.1,在 EmbSpatial 上提升 +5.2,在 QVHighlight 上提升 +22.5。在時間定位任務上,其提升尤為顯著:QVHighlight 提升 +22.5,ActivityNet 提升 +17.1,VideoEval-Pro 提升 +24.5。在流式場景中,其認知門在 SoccerNet 流式基準上取得了領先的 TimVal / F1 / ROC-AUC / PR-AUC 分數,並能泛化到真實的 2026 年世界盃轉播。
值得注意的是,Mage-VL 的視覺編碼器完全從零訓練,未使用任何大規模影像-文本預訓練 ViT 初始化。這種「編解碼器原生」的方法,加上預測性 patch 機制,使得在相同預算下,模型可以訓練 8 倍更長 的影片。在原生解析度擴充套件方面,Mage-ViT 的效能隨 token 預算單調提升,在 676 個 token 時達到峰值(Food-101 上 96.1%,ImageNet 上 86.3%),而固定解析度的編碼器則會飽和或退化。
微軟同時釋出了兩個檢查點:microsoft/Mage-VL 是一個統一模型,同時提供影像/影片理解與主動流式門控功能,覆蓋所有 Mage-VL 能力;microsoft/Mage-ViT 則是獨立的視覺編碼器,僅經過 ViT 預訓練,未與語言模型進行聯合 VLM 訓練,可作為資料高效的編解碼器原生視覺編碼器或用於自定義多模態訓練的即插即用 ViT。
從產業視角看,Mage-VL 代表了多模態模型在效率與即時性上的重要探索。通過減少視覺 token 消耗和加速推理,它有望降低影片理解類應用的計算成本與延遲,尤其對需要即時響應的場景(如直播分析、智慧監控、自動駕駛輔助等)具有潛在價值。同時,其從零訓練視覺編碼器的做法,也挑戰了依賴大規模預訓練 ViT 的常規路徑,可能為資源受限的團隊提供新的建模思路。不過,該模型目前仍處於釋出初期,其實際部署效果與生態支援有待進一步觀察。