微軟在Hugging Face平台開源了Mage-ViT視覺編碼器,這是其此前釋出的Mage-VL多模態大模型的核心視覺元件。該模型約3.16億引數,採用創新的編解碼器對齊稀疏化原則(codec-aligned sparsity),專為影片理解場景設計,將單張影像視為影片的單幀退化情況。
Mage-ViT的核心思路是利用影片編解碼器的位元分配作為時空重要性的天然代理:在共享的16×16塊網格上,模型保留所有關鍵幀(I幀)塊,僅保留運動顯著的預測幀(P幀)塊,從而大幅減少視覺token數量。對於64幀的影片片段,模型在4096個token預算內保留所有I幀塊及top-k個P幀塊,實現約75%的token壓縮。模型採用共享的3D旋轉位置編碼,即使丟棄大量網格塊也能保持時空結構。
該編碼器支援兩種編解碼器介面:傳統HEVC/H.265(基於運動向量和P幀殘差能量生成重要性圖)與神經編解碼器DCVC-RT(基於學習率圖),無需修改架構或重新訓練即可切換。模型從零開始訓練,未使用任何十億級圖文ViT初始化,而是通過大規模聚類判別目標在約1億張無標註影像/影片上最佳化。
架構方面,Mage-ViT採用24層預層歸一化Vision Transformer主幹,隱藏層大小1024,16個注意力頭,GELU啟用的MLP以4倍擴充套件。預訓練分兩階段進行:先進行可變解析度影像預訓練(224–448畫素),再進行影像與影片聯合預訓練(影片解析度256,每片段64幀)。權重以bfloat16精度儲存,採用Apache-2.0許可證。
此次開源的僅為ViT預訓練檢查點,尚未經過與語言模型的聯合VLM訓練。微軟將其定位為資料高效的編解碼器原生視覺編碼器,可直接用於多模態訓練。對於AI產業而言,這種從零訓練、高效稀疏化的視覺編碼方案,可能為影片理解任務提供更低算力成本的替代路徑,尤其適合需要處理大量影片資料的應用場景。