Sand.ai 于近日开源了其最新视频生成模型 MAGI-2-preview,宣称这是全球首个千亿参数级别的MoE(混合专家)视频生成模型。该模型总参数达 114B,但每次推理仅激活 6B 参数,据称生成一段 10秒1080P 视频的成本仅需 5毛钱,约为行业主流模型的 十分之一。在AA视频生成榜单上,MAGI-2-preview排名 第六,仅凭6B激活参数便已接近第一梯队水平。

视频生成模型面临“不可能三角”:模型规模要大、视频长度要长、成本还要可控。Sand.ai通过MoE架构将模型容量与单次计算解耦,使模型拥有千亿总容量,但推理时只激活部分专家,从而控制成本。MAGI-2-preview采用 Multi-Head LatentMoE 思路,将 3072维 隐藏表示拆分为 12个256维 的head,每个head独立路由,在 36层 主体网络中每层设置 3072个 专家单元,每个token在每个head内选择6个专家,合计激活 72个 小专家。相比DeepSeek-V4-Pro等主流MoE模型每层数百个专家,MAGI-2-preview将专家数量提升至三千级别,通过更细粒度的分工增强模型能力组合。

在架构上,MAGI-2-preview延续了Sand.ai在daVinci-MagiHuman中验证的 单流架构,文本、视频和音频进入同一个Transformer,在每一层自注意力中直接交换信息,而非传统做法中视频、音频各自处理后再用交叉注意力融合。这种设计从第一层开始就共同建模画面与声音,更适合处理细微的音画对应关系,同时统一主干降低了延迟和维护成本,也更利于MoE扩展。

为支撑如此大规模的MoE,Sand.ai自研了 MagiMoE kernel库,将路由、排序、专家计算整条链路压缩,减少中间结果的显存搬运。采用 Head Parallel 技术,在路由发生前就按head将计算分配到不同设备,设备间传输形状固定的head表示,而非路由后数量不断变化的专家token。优化器采用混合设计:矩阵参数用 Muon,专家参数用 AdamW,以适应不同性质参数的更新节奏。训练策略上,预训练阶段尽可能完整覆盖数据分布,后训练阶段则专注于偏好对齐、可控性、安全性和产品适配。

Sand.ai创始人 曹越 是清华大学特等奖学金获得者、Swin Transformer共同一作,曾联合创办光年之外,并在智源研究院负责多模态与视觉研究。团队技术背景深厚,更倾向于将资源押注在基础模型和底层基础设施上。创新工场董事长 李开复 曾公开推荐该团队,称其为“AI视频生成界的DeepSeek”。

MAGI-2-preview的开源意味着视频生成领域的竞争从单纯的效果比拼,扩展到模型可训练性、部署控制权等维度。对于金融、医疗、工业等数据敏感行业,数据能否留在本地、模型能否针对业务继续训练,重要性不亚于生成效果。闭源模型依赖产品体验和服务稳定性,开源模型则依靠部署、控制和开发者生态,两条路线开始在更多层面正面碰撞。

尽管MAGI-2-preview已展现出潜力,但它并非视频生成的最终答案,正式版仍在开发中。其开源地址为 https://github.com/SandAI-org/MAGI-2-preview,开发者可自行下载体验。