德国AI公司黑森林实验室(Black Forest Labs)近日发布其最新多模态基础模型 Flux 3,首次实现了视频与原生音频的同步生成,最长可达 20 秒。这是该公司自推出图像生成模型Flux以来,在视频与多模态领域的重要跨越。
Flux 3 是一个同时学习图像、视频和音频的多模态基础模型。黑森林实验室将其定位为迈向“真实世界视觉智能”的一步,即模型能够“在物理和数字环境中感知、预测并采取行动”。公司认为,单一模态无法完整捕捉现实:图像呈现空间结构,视频记录时间变化,音频则揭示机械事件与声音之间的关联。三者联合训练,可使模型获得比单独训练更丰富的信息。
在功能上,Flux 3 支持文本到视频、图像到视频、视频到视频、关键帧过渡、多语言对话以及通过智能体驱动的片段链接以生成长序列。公司特别指出,该模型在人类面部表情和声音与物理事件的匹配方面表现突出。
在内部初步评估中,黑森林实验室使用 10 秒 720p 视频片段进行了用户偏好测试。结果显示,Flux 3 在对比中大幅领先部分竞品:相对于 Luma Ray 3.2 偏好率为 93%,相对于 Runway Gen-4.5 为 77%,相对于 Grok Imagine Video 为 69%。面对更强对手时优势缩小:相对于 Kling v3 Pro 为 60%,相对于 Happy Horse v1 为 59%,相对于 Happy Horse 1.1 为 57%,而相对于市场领先者 Seedance 2.0 和 Gemini Omni Flash 均为 52%。公司强调这些结果仍是初步的,尚无独立第三方测试验证。能与已进入好莱坞的 Seedance 以及 Gemini Omni Flash 持平,意味着 Flux 3 已跻身顶级视频模型行列。
除了视频生成,Flux 3 还将提升图像生成能力,特别是在复杂提示词和多语言准确文本渲染方面。黑森林实验室计划在未来几周内推出 Flux 3 Image 的早期访问版本。
更值得关注的是,黑森林实验室与 Mimic Robotics 合作开发了 Flux-mimic,一个面向机器人应用的视频动作模型。该模型目前已在 奥迪 的产线上进行生产任务测试。Flux 3 的架构中专门包含一个“动作”组件,为机器人应用提供了基础。公司表示,这种统一学习过程在生成质量和模型对物理世界的理解上都优于此前标准的流匹配方法。
Flux 3 基于黑森林实验室自研的 Self-Flow 方法,该方法使单一模型能够同时生成和理解内容。模型采用多模态Transformer架构,通过专用编码器和解码器将图像、视频和音频转换为共享内部表示,再转换回输出。
在发布策略上,黑森林实验室计划分阶段推出所有能力,每个阶段都设有早期访问期以进行反馈和安全测试。Flux 3 Video 现已可用,Flux 3 Image 将在数周后跟进,动作预测功能最初仅通过精选合作伙伴提供。公司还计划以“Flux 3 Dev”名称开放多模态骨干网络的权重。长期来看,黑森林实验室正在研发下一代模型,旨在将感知、行动和语言预测整合到单一模型中。