微軟在Hugging Face上釋出了Mage-VL,一款面向影像與影片理解的多模態基礎模型。該模型的核心創新在於其視覺編碼器Mage-ViT完全從零開始訓練(引數量40億),沒有使用任何大規模圖文對資料進行預訓練,打破了當前主流多模態模型依賴SigLIP或CLIP等預訓練視覺編碼器的慣例。
Mage-VL的設計靈感來源於現代影片編解碼器(如H.264/HEVC)的工作原理。傳統方法將影片均勻取樣為密集幀序列,再通過預訓練的視覺Transformer(ViT)處理大量影像塊token,計算開銷巨大。Mage-VL則模仿編解碼器的幀結構,將影片流區分為關鍵幀(I幀)和預測幀(P幀):完整保留I幀的所有影像塊,僅保留P幀中編解碼器實際分配位元的區域(即包含運動或新細節的部分)。這種基於編解碼器的稀疏化策略可減少超過75%的視覺token消耗,在保持同等準確率的前提下,推理速度相比均勻幀取樣提升最高3.5倍。
Mage-VL採用雙元件架構:Mage-ViT負責從零訓練的視覺編碼,通過共享的16×16影像塊網格與3D旋轉位置編碼,依據編解碼器匯出的時空重要性分配token;語言骨幹則採用Qwen3-4B-Instruct-2507(唯一使用預訓練元件的部分),通過輕量兩層MLP投影器接收Mage-ViT輸出的變長token流。該架構統一支援影像、短/長/超長影片以及即時流式輸入。
在效能方面,Mage-ViT僅使用約1億張無標註影像/影片進行訓練,便在CIFAR-10上達到99.33%、ImageNet上達到85.69%(256 token)的準確率,與基於數十億圖文對訓練的SigLIP2(100億資料)和MoonViT(20億資料)相當或更優。在影片理解任務上,固定Qwen3-4B骨幹僅替換視覺編碼器後,Mage-VL在所有報告的基準上均超越Qwen3-VL-4B,尤其在時序定位任務上提升顯著:QVHighlight提升22.5分、ActivityNet提升17.1分、VSI-Bench提升11.0分、VideoEval-Pro提升24.5分。
Mage-VL還內建了System 1 / System 2雙過程設計,實現單模型內的主動流式處理。一個輕量級認知門控(System 1)持續監控編解碼器視窗,僅在檢測到值得響應的事件時才啟用完整VLM(System 2)生成回覆,無需多智慧體管線。該門控在SoccerNet流式基準上取得領先的TimVal、F1、ROC-AUC和PR-AUC指標,並已泛化到真實的2026年世界盃轉播場景。
微軟此次釋出兩個檢查點:microsoft/Mage-VL(統一模型,支援影像理解、幀取樣影片、傳統H.264/HEVC編解碼影片、神經DCVC-RT編解碼影片以及事件門控流式處理)和microsoft/Mage-ViT(僅視覺編碼器預訓練檢查點,未經過VLM聯合訓練,可作為資料高效的編解碼原生視覺編碼器供社群使用)。Mage-VL的釋出表明,不依賴大規模圖文預訓練也能構建強大的多模態視覺前端,這可能為降低多模態模型的訓練門檻與推理成本提供新思路。