微软在Hugging Face平台开源了Mage-ViT视觉编码器,这是其此前发布的Mage-VL多模态大模型的核心视觉组件。该模型约3.16亿参数,采用创新的编解码器对齐稀疏化原则(codec-aligned sparsity),专为视频理解场景设计,将单张图像视为视频的单帧退化情况。

Mage-ViT的核心思路是利用视频编解码器的比特分配作为时空重要性的天然代理:在共享的16×16块网格上,模型保留所有关键帧(I帧)块,仅保留运动显著的预测帧(P帧)块,从而大幅减少视觉token数量。对于64帧的视频片段,模型在4096个token预算内保留所有I帧块及top-k个P帧块,实现约75%的token压缩。模型采用共享的3D旋转位置编码,即使丢弃大量网格块也能保持时空结构。

该编码器支持两种编解码器接口:传统HEVC/H.265(基于运动向量和P帧残差能量生成重要性图)与神经编解码器DCVC-RT(基于学习率图),无需修改架构或重新训练即可切换。模型从零开始训练,未使用任何十亿级图文ViT初始化,而是通过大规模聚类判别目标在约1亿张无标注图像/视频上优化。

架构方面,Mage-ViT采用24层预层归一化Vision Transformer主干,隐藏层大小1024,16个注意力头,GELU激活的MLP以4倍扩展。预训练分两阶段进行:先进行可变分辨率图像预训练(224–448像素),再进行图像与视频联合预训练(视频分辨率256,每片段64帧)。权重以bfloat16精度存储,采用Apache-2.0许可证。

此次开源的仅为ViT预训练检查点,尚未经过与语言模型的联合VLM训练。微软将其定位为数据高效的编解码器原生视觉编码器,可直接用于多模态训练。对于AI产业而言,这种从零训练、高效稀疏化的视觉编码方案,可能为视频理解任务提供更低算力成本的替代路径,尤其适合需要处理大量视频数据的应用场景。