以影像生成模型 FLUX 聞名的黑森林實驗室(Black Forest Labs,BFL)正式跨入機器人領域,釋出開源模型 FLUX 3 Action。該模型定位為「世界-動作模型」(world-action model),接收機器人工作區的多路攝像頭影片流,預測智慧體下一步應當執行的動作,以及環境會隨之發生怎樣的變化。
FLUX 3 Action 建立在多模態模型 FLUX 3 之上。據 BFL 介紹,FLUX 3 的訓練資料以影片為主,同時涵蓋影像與音訊。這種多模態底座為模型理解真實工作場景提供了基礎,而 FLUX 3 Action 則在此基礎上進一步輸出動作決策。
在衡量機器人任務表現的 RoboLab-120 榜單上,FLUX 3 Action 重新整理了成功率紀錄。值得注意的是它的體量:據 BFL 稱,該模型僅有 70 億引數,不到此前表現最好的開源模型的一半,同時執行速度最高可達後者的 3.95 倍。這一「小體積、高速度」的組合,是 BFL 強調的核心賣點。
BFL 給出的邏輯是,大型推理模型雖然規劃能力出色,但對機器人而言往往過慢、過於笨重,難以滿足即時控制的需求。因此,把模型壓縮到能在裝置端直接執行,對機器人落地至關重要。FLUX 3 Action 的引數量與推理速度,正是圍繞這一目標設計的。
除了物理機器人,BFL 還看到了數字環境中的潛在用途。影片遊戲可以作為導航與快速反應智慧體的測試場,而能夠操作計算機的智慧體也可能沿著這條路徑發展。這意味著該模型的能力邊界並不侷限於機械臂或移動底盤,還可能延伸到虛擬環境中的互動任務。
開放程度方面,FLUX 3 Action 的權重已釋出在 Hugging Face 上,延續了 BFL 在開源社群的一貫做法。對於機器人研究者與開發者而言,這意味著可以直接下載、微調並在自有硬體上驗證。
從產業視角看,這條訊息的看點在於「世界-動作模型」這一品類的競爭正在升溫。此前該方向多由專注機器人學習的團隊主導,而 BFL 憑藉在生成式視覺模型上的積累切入,帶來的是多模態感知與動作預測的結合。70 億引數級別能在榜單上取得領先,說明模型架構與訓練資料的效率可能比單純堆引數更重要。
對關注 AI 產業鏈的讀者來說,值得跟蹤的線索有幾條:一是端側推理需求上升,對邊緣算力與低功耗晶片的拉動;二是開源權重釋放後,機器人初創公司與研究機構能否快速在其上構建應用;三是 BFL 能否把影像生成領域的品牌優勢,轉化為機器人開發者生態中的實際採用。目前這些仍有待觀察,但 FLUX 3 Action 的釋出,已經把這家公司從「影像模型廠商」的標籤,擴充套件到了具身智慧的討論範圍內。