微軟於近日在 Hugging Face 平台開源了 Mage-Flow 系列模型,這是一個引數量僅為 4B(40 億)的生成式 AI 框架,同時支援文本到影像生成與基於指令的影像編輯。與當前主流思路不同,Mage-Flow 沒有選擇堆砌數百億引數,而是通過編碼器-骨幹網路-系統的聯合設計,在保持輕量、低記憶體佔用和易微調的同時,實現了與 Qwen-Image 20B、FLUX.2 32B、FireRed-Image-Edit 20B 等更大開源系統相當甚至更優的生成質量。

Mage-Flow 的核心由兩個共享元件構成:Mage-VAE 是一個輕量級高保真潛空間編碼器,採用單步擴散編解碼與錨點潛變數 KL 正則化,在重建保真度上與 FLUX.2-VAE 持平,但每畫素的編碼與解碼計算量分別降低了約 12 倍22 倍,從而消除了高解析度場景下 VAE 成為效能瓶頸的問題。NR-MMDiT 是一個共享的 4B 原生解析度多模態擴散 Transformer,在 Mage-VAE 的潛空間中通過整流流匹配進行訓練。結合原生解析度打包技術與融合 CUDA 核心訓練基礎設施,該共享框架衍生出兩個模型例項:Mage-Flow(文本到影像生成)與 Mage-Flow-Edit(指令式影像編輯),每個例項又包含 Base、RL 對齊和 4 步 Turbo 三種變體。

在效能方面,Mage-Flow 系列展現出顯著的效率優勢。在單張 A100 GPU 上,Mage-Flow-Turbo 生成一張 1024×1024 影像僅需 0.59 秒,Mage-Flow-Edit-Turbo 完成一次編輯只需 1.02 秒,峰值視訊記憶體佔用約 18–20 GB,在所有對比系統中最低。系統級最佳化將模型浮點利用率從約 33% 提升至約 77%,訓練速度加快約 2.5 倍。Mage-Flow 還支援從 5122048 畫素的任何解析度與寬高比,包括極端的 4:1 比例(如 512×2048 或 2048×512),一個檢查點即可覆蓋多種輸出需求。

在影像編輯方面,Mage-Flow-Edit 支援語義內容編輯、外觀變換、影像恢復以及結構感知輸出,統一在一個影像與文本條件模型中完成。官方展示的編輯案例涵蓋區域性內容物件編輯、場景與主體相機變換、藝術風格渲染、人像創意編輯、低層視覺條件重建以及雙向退化恢復等多種任務。

Mage-Flow 的開源策略採用 MIT 許可證,所有檢查點均以 diffusers 格式釋出,包含獨立的 transformer、共享 VAE、文本編碼器和排程器目錄,便於社群直接使用和二次開發。這一系列模型的釋出,為 AI 影像生成與編輯領域提供了一條不同於“引數軍備競賽”的路徑,即通過系統級協同設計,在有限計算預算下實現高效、高質量的生成能力。對於關注 AI 產業基礎設施與模型層的投資者而言,Mage-Flow 的實踐可能影響未來影像生成模型的部署成本、邊緣裝置適配以及開源生態的競爭格局。