Sand.ai 於近日開源了其最新影片生成模型 MAGI-2-preview,宣稱這是全球首個千億引數級別的MoE(混合專家)影片生成模型。該模型總引數達 114B,但每次推理僅啟用 6B 引數,據稱生成一段 10秒1080P 影片的成本僅需 5毛錢,約為行業主流模型的 十分之一。在AA影片生成榜單上,MAGI-2-preview排名 第六,僅憑6B啟用引數便已接近第一梯隊水平。
影片生成模型面臨“不可能三角”:模型規模要大、影片長度要長、成本還要可控。Sand.ai通過MoE架構將模型容量與單次計算解耦,使模型擁有千億總容量,但推理時只啟用部分專家,從而控制成本。MAGI-2-preview採用 Multi-Head LatentMoE 思路,將 3072維 隱藏表示拆分為 12個256維 的head,每個head獨立路由,在 36層 主體網路中每層設定 3072個 專家單元,每個token在每個head內選擇6個專家,合計啟用 72個 小專家。相比DeepSeek-V4-Pro等主流MoE模型每層數百個專家,MAGI-2-preview將專家數量提升至三千級別,通過更細粒度的分工增強模型能力組合。
在架構上,MAGI-2-preview延續了Sand.ai在daVinci-MagiHuman中驗證的 單流架構,文本、影片和音訊進入同一個Transformer,在每一層自注意力中直接交換資訊,而非傳統做法中影片、音訊各自處理後再用交叉注意力融合。這種設計從第一層開始就共同建模畫面與聲音,更適合處理細微的音畫對應關係,同時統一主幹降低了延遲和維護成本,也更利於MoE擴充套件。
為支撐如此大規模的MoE,Sand.ai自研了 MagiMoE kernel庫,將路由、排序、專家計算整條鏈路壓縮,減少中間結果的視訊記憶體搬運。採用 Head Parallel 技術,在路由發生前就按head將計算分配到不同裝置,裝置間傳輸形狀固定的head表示,而非路由後數量不斷變化的專家token。最佳化器採用混合設計:矩陣引數用 Muon,專家引數用 AdamW,以適應不同性質引數的更新節奏。訓練策略上,預訓練階段儘可能完整覆蓋資料分佈,後訓練階段則專注於偏好對齊、可控性、安全性和產品適配。
Sand.ai創始人 曹越 是清華大學特等獎學金獲得者、Swin Transformer共同一作,曾聯合創辦光年之外,並在智源研究院負責多模態與視覺研究。團隊技術背景深厚,更傾向於將資源押注在基礎模型和底層基礎設施上。創新工場董事長 李開復 曾公開推薦該團隊,稱其為“AI影片生成界的DeepSeek”。
MAGI-2-preview的開源意味著影片生成領域的競爭從單純的效果比拼,擴充套件到模型可訓練性、部署控制權等維度。對於金融、醫療、工業等資料敏感行業,資料能否留在本地、模型能否針對業務繼續訓練,重要性不亞於生成效果。閉源模型依賴產品體驗和服務穩定性,開源模型則依靠部署、控制和開發者生態,兩條路線開始在更多層面正面碰撞。
儘管MAGI-2-preview已展現出潛力,但它並非影片生成的最終答案,正式版仍在開發中。其開源地址為 https://github.com/SandAI-org/MAGI-2-preview,開發者可自行下載體驗。