微软在Hugging Face上发布了Mage-VL,一款面向图像与视频理解的多模态基础模型。该模型的核心创新在于其视觉编码器Mage-ViT完全从零开始训练(参数量40亿),没有使用任何大规模图文对数据进行预训练,打破了当前主流多模态模型依赖SigLIPCLIP等预训练视觉编码器的惯例。

Mage-VL的设计灵感来源于现代视频编解码器(如H.264/HEVC)的工作原理。传统方法将视频均匀采样为密集帧序列,再通过预训练的视觉Transformer(ViT)处理大量图像块token,计算开销巨大。Mage-VL则模仿编解码器的帧结构,将视频流区分为关键帧(I帧)预测帧(P帧):完整保留I帧的所有图像块,仅保留P帧中编解码器实际分配比特的区域(即包含运动或新细节的部分)。这种基于编解码器的稀疏化策略可减少超过75%的视觉token消耗,在保持同等准确率的前提下,推理速度相比均匀帧采样提升最高3.5倍

Mage-VL采用双组件架构:Mage-ViT负责从零训练的视觉编码,通过共享的16×16图像块网格与3D旋转位置编码,依据编解码器导出的时空重要性分配token;语言骨干则采用Qwen3-4B-Instruct-2507(唯一使用预训练组件的部分),通过轻量两层MLP投影器接收Mage-ViT输出的变长token流。该架构统一支持图像、短/长/超长视频以及实时流式输入。

在性能方面,Mage-ViT仅使用约1亿张无标注图像/视频进行训练,便在CIFAR-10上达到99.33%、ImageNet上达到85.69%(256 token)的准确率,与基于数十亿图文对训练的SigLIP2(100亿数据)和MoonViT(20亿数据)相当或更优。在视频理解任务上,固定Qwen3-4B骨干仅替换视觉编码器后,Mage-VL在所有报告的基准上均超越Qwen3-VL-4B,尤其在时序定位任务上提升显著:QVHighlight提升22.5分、ActivityNet提升17.1分、VSI-Bench提升11.0分、VideoEval-Pro提升24.5分。

Mage-VL还内置了System 1 / System 2双过程设计,实现单模型内的主动流式处理。一个轻量级认知门控(System 1)持续监控编解码器窗口,仅在检测到值得响应的事件时才激活完整VLM(System 2)生成回复,无需多智能体管线。该门控在SoccerNet流式基准上取得领先的TimVal、F1、ROC-AUC和PR-AUC指标,并已泛化到真实的2026年世界杯转播场景。

微软此次发布两个检查点:microsoft/Mage-VL(统一模型,支持图像理解、帧采样视频、传统H.264/HEVC编解码视频、神经DCVC-RT编解码视频以及事件门控流式处理)和microsoft/Mage-ViT(仅视觉编码器预训练检查点,未经过VLM联合训练,可作为数据高效的编解码原生视觉编码器供社区使用)。Mage-VL的发布表明,不依赖大规模图文预训练也能构建强大的多模态视觉前端,这可能为降低多模态模型的训练门槛与推理成本提供新思路。