德國AI公司黑森林實驗室(Black Forest Labs)近日釋出其最新多模態基礎模型 Flux 3,首次實現了影片與原生音訊的同步生成,最長可達 20 秒。這是該公司自推出影像生成模型Flux以來,在影片與多模態領域的重要跨越。
Flux 3 是一個同時學習影像、影片和音訊的多模態基礎模型。黑森林實驗室將其定位為邁向“真實世界視覺智慧”的一步,即模型能夠“在物理和數字環境中感知、預測並採取行動”。公司認為,單一模態無法完整捕捉現實:影像呈現空間結構,影片記錄時間變化,音訊則揭示機械事件與聲音之間的關聯。三者聯合訓練,可使模型獲得比單獨訓練更豐富的資訊。
在功能上,Flux 3 支援文本到影片、影像到影片、影片到影片、關鍵幀過渡、多語言對話以及通過智慧體驅動的片段連結以生成長序列。公司特別指出,該模型在人類面部表情和聲音與物理事件的匹配方面表現突出。
在內部初步評估中,黑森林實驗室使用 10 秒 720p 影片片段進行了使用者偏好測試。結果顯示,Flux 3 在對比中大幅領先部分競品:相對於 Luma Ray 3.2 偏好率為 93%,相對於 Runway Gen-4.5 為 77%,相對於 Grok Imagine Video 為 69%。面對更強對手時優勢縮小:相對於 Kling v3 Pro 為 60%,相對於 Happy Horse v1 為 59%,相對於 Happy Horse 1.1 為 57%,而相對於市場領先者 Seedance 2.0 和 Gemini Omni Flash 均為 52%。公司強調這些結果仍是初步的,尚無獨立第三方測試驗證。能與已進入好萊塢的 Seedance 以及 Gemini Omni Flash 持平,意味著 Flux 3 已躋身頂級影片模型行列。
除了影片生成,Flux 3 還將提升影像生成能力,特別是在複雜提示詞和多語言準確文本渲染方面。黑森林實驗室計劃在未來幾周內推出 Flux 3 Image 的早期訪問版本。
更值得關注的是,黑森林實驗室與 Mimic Robotics 合作開發了 Flux-mimic,一個面向機器人應用的影片動作模型。該模型目前已在 奧迪 的產線上進行生產任務測試。Flux 3 的架構中專門包含一個“動作”元件,為機器人應用提供了基礎。公司表示,這種統一學習過程在生成質量和模型對物理世界的理解上都優於此前標準的流匹配方法。
Flux 3 基於黑森林實驗室自研的 Self-Flow 方法,該方法使單一模型能夠同時生成和理解內容。模型採用多模態Transformer架構,通過專用編碼器和解碼器將影像、影片和音訊轉換為共享內部表示,再轉換回輸出。
在釋出策略上,黑森林實驗室計劃分階段推出所有能力,每個階段都設有早期訪問期以進行反饋和安全測試。Flux 3 Video 現已可用,Flux 3 Image 將在數週後跟進,動作預測功能最初僅通過精選合作伙伴提供。公司還計劃以“Flux 3 Dev”名稱開放多模態骨幹網路的權重。長期來看,黑森林實驗室正在研發下一代模型,旨在將感知、行動和語言預測整合到單一模型中。