以图像生成模型 FLUX 闻名的黑森林实验室(Black Forest Labs,BFL)正式跨入机器人领域,发布开源模型 FLUX 3 Action。该模型定位为「世界-动作模型」(world-action model),接收机器人工作区的多路摄像头视频流,预测智能体下一步应当执行的动作,以及环境会随之发生怎样的变化。

FLUX 3 Action 建立在多模态模型 FLUX 3 之上。据 BFL 介绍,FLUX 3 的训练数据以视频为主,同时涵盖图像与音频。这种多模态底座为模型理解真实工作场景提供了基础,而 FLUX 3 Action 则在此基础上进一步输出动作决策。

在衡量机器人任务表现的 RoboLab-120 榜单上,FLUX 3 Action 刷新了成功率纪录。值得注意的是它的体量:据 BFL 称,该模型仅有 70 亿参数,不到此前表现最好的开源模型的一半,同时运行速度最高可达后者的 3.95 倍。这一「小体积、高速度」的组合,是 BFL 强调的核心卖点。

BFL 给出的逻辑是,大型推理模型虽然规划能力出色,但对机器人而言往往过慢、过于笨重,难以满足实时控制的需求。因此,把模型压缩到能在设备端直接运行,对机器人落地至关重要。FLUX 3 Action 的参数量与推理速度,正是围绕这一目标设计的。

除了物理机器人,BFL 还看到了数字环境中的潜在用途。视频游戏可以作为导航与快速反应智能体的测试场,而能够操作计算机的智能体也可能沿着这条路径发展。这意味着该模型的能力边界并不局限于机械臂或移动底盘,还可能延伸到虚拟环境中的交互任务。

开放程度方面,FLUX 3 Action 的权重已发布在 Hugging Face 上,延续了 BFL 在开源社区的一贯做法。对于机器人研究者与开发者而言,这意味着可以直接下载、微调并在自有硬件上验证。

从产业视角看,这条消息的看点在于「世界-动作模型」这一品类的竞争正在升温。此前该方向多由专注机器人学习的团队主导,而 BFL 凭借在生成式视觉模型上的积累切入,带来的是多模态感知与动作预测的结合。70 亿参数级别能在榜单上取得领先,说明模型架构与训练数据的效率可能比单纯堆参数更重要。

对关注 AI 产业链的读者来说,值得跟踪的线索有几条:一是端侧推理需求上升,对边缘算力与低功耗芯片的拉动;二是开源权重释放后,机器人初创公司与研究机构能否快速在其上构建应用;三是 BFL 能否把图像生成领域的品牌优势,转化为机器人开发者生态中的实际采用。目前这些仍有待观察,但 FLUX 3 Action 的发布,已经把这家公司从「图像模型厂商」的标签,扩展到了具身智能的讨论范围内。