在 7 月悉尼 RSS 2026 大会最后一天的“机器人世界模型”研讨会上,英伟达物理 AI 专家 Max Li 详细拆解了公司最新发布的 Cosmos 3——一个号称全球首个在统一 Transformer 架构下打通文本、视觉、音频和动作全模态的世界基础模型。这一发布被视为英伟达在具身智能领域从硬件霸主向平台标准制定者迈出的关键一步。

Max Li 在演讲中直言,物理 AI 领域最大的挑战是数据。与计算机视觉或大语言模型不同,物理世界的数据获取受限于时间和空间的线性特征,无法像扩展算力那样轻松扩展。因此,英伟达提出“世界基础模型”概念,希望它能成为众多物理 AI 应用的基石。Cosmos 3 的核心能力包括理解世界、模拟未来和执行动作——模型既能像视觉语言模型(VLM)一样推理观测视频,也能生成视频、音频和动作,甚至通过反向动力学从多视角视频反推底层动作,从而挖掘海量无标注视频数据。

在架构上,Cosmos 3 采用混合专家(MoE)设计,分为负责理解的“推理器”和负责跨模态生成的“生成器”。推理时使用因果自注意力,生成时使用双向注意力。为统一不同机器人形态的动作矢量,团队使用启发式规则将汽车、相机、单臂/双臂机器人及人形机器人的动作向量在语义空间中耦合。模型通过三种模式训练:动力学模式(给定动作预测视频)、逆动力学模式(给定视频预测动作)和策略模式(视频与动作联合训练)。为处理多模态位置编码,视频在三维空间递增索引,音频与动作仅用时间轴,并以 24 FPS 为基准对齐时间同步。

数据方面,预训练阶段为推理器筛选了约 2200 万个可训练样本,生成器端则拥有约 220 万个样本,预训练数据折合约 1000 万小时视频。训练分三阶段:预训练(图像/视频生成)、中期训练(引入动作与跨域仿真数据)和后期训练(针对策略输出优化)。Cosmos 3 提供三个版本:Edge(4B 参数,双专家塔各 2B)、Nano(16B 参数,推理器与生成器各 8B)和 Super(64B 参数,各 32B)。Max Li 强调,在图像和视频生成上,更大模型优势明显,扩展定律清晰可见。

值得关注的是,Cosmos 3 完全开源。Max Li 承诺将手动回复 GitHub 上的所有 Issue,并透露该项目有超过 100 人参与。这一开放策略旨在吸引全球开发者,使 Cosmos 成为具身智能时代的“安卓系统”——通过定义标准化的“大脑与肢体”协议,让碎片化的机器人形态在统一逻辑底座上进化。

在问答环节,Max Li 回应了关于动作落地差距的质疑:预训练阶段模型纯粹作为状态转移机器,不包含 PID 控制信息;直到后期训练才引入控制信号,使模型在特定机器人上真正实用。他承认,虽然尚未有全局统计数据证明加入动作能提升所有领域的物理预测精度,但在机器人和具身智能相关领域,引入动作显著提升了未来视觉走向的预测精度。

Cosmos 3 的发布折射出 AI 行业的核心矛盾:云端算力指数级爆发与机器人终端落地步履蹒跚之间的鸿沟。英伟达试图通过将 AGI 大脑迁移至 Jetson 等边缘设备实时运行,终结机器人“背着服务器跑”的包袱。这一布局若成功,英伟达将从算力供应商延伸为机器人时代的平台标准制定者,深刻影响 AI 产业链上下游的竞争格局。不过,Cosmos 3 能否真正统一碎片化的机器人生态,仍需时间检验。