在 7 月悉尼 RSS 2026 大會最後一天的“機器人世界模型”研討會上,輝達物理 AI 專家 Max Li 詳細拆解了公司最新發布的 Cosmos 3——一個號稱全球首個在統一 Transformer 架構下打通文本、視覺、音訊和動作全模態的世界基礎模型。這一發布被視為輝達在具身智慧領域從硬體霸主向平台標準制定者邁出的關鍵一步。
Max Li 在演講中直言,物理 AI 領域最大的挑戰是資料。與計算機視覺或大語言模型不同,物理世界的資料獲取受限於時間和空間的線性特徵,無法像擴充套件算力那樣輕鬆擴充套件。因此,輝達提出“世界基礎模型”概念,希望它能成為眾多物理 AI 應用的基石。Cosmos 3 的核心能力包括理解世界、模擬未來和執行動作——模型既能像視覺語言模型(VLM)一樣推理觀測影片,也能生成影片、音訊和動作,甚至通過反向動力學從多視角影片反推底層動作,從而挖掘海量無標註影片資料。
在架構上,Cosmos 3 採用混合專家(MoE)設計,分為負責理解的“推理器”和負責跨模態生成的“生成器”。推理時使用因果自注意力,生成時使用雙向注意力。為統一不同機器人形態的動作向量,團隊使用啟發式規則將汽車、相機、單臂/雙臂機器人及人形機器人的動作向量在語義空間中耦合。模型通過三種模式訓練:動力學模式(給定動作預測影片)、逆動力學模式(給定影片預測動作)和策略模式(影片與動作聯合訓練)。為處理多模態位置編碼,影片在三維空間遞增索引,音訊與動作僅用時間軸,並以 24 FPS 為基準對齊時間同步。
資料方面,預訓練階段為推理器篩選了約 2200 萬個可訓練樣本,生成器端則擁有約 220 萬個樣本,預訓練資料摺合約 1000 萬小時影片。訓練分三階段:預訓練(影像/影片生成)、中期訓練(引入動作與跨域模擬資料)和後期訓練(針對策略輸出最佳化)。Cosmos 3 提供三個版本:Edge(4B 引數,雙專家塔各 2B)、Nano(16B 引數,推理器與生成器各 8B)和 Super(64B 引數,各 32B)。Max Li 強調,在影像和影片生成上,更大模型優勢明顯,擴充套件定律清晰可見。
值得關注的是,Cosmos 3 完全開源。Max Li 承諾將手動回覆 GitHub 上的所有 Issue,並透露該專案有超過 100 人參與。這一開放策略旨在吸引全球開發者,使 Cosmos 成為具身智慧時代的“安卓系統”——通過定義標準化的“大腦與肢體”協議,讓碎片化的機器人形態在統一邏輯底座上進化。
在問答環節,Max Li 回應了關於動作落地差距的質疑:預訓練階段模型純粹作為狀態轉移機器,不包含 PID 控制資訊;直到後期訓練才引入控制訊號,使模型在特定機器人上真正實用。他承認,雖然尚未有全域性統計資料證明加入動作能提升所有領域的物理預測精度,但在機器人和具身智慧相關領域,引入動作顯著提升了未來視覺走向的預測精度。
Cosmos 3 的釋出折射出 AI 行業的核心矛盾:雲端算力指數級爆發與機器人終端落地步履蹣跚之間的鴻溝。輝達試圖通過將 AGI 大腦遷移至 Jetson 等邊緣裝置即時執行,終結機器人“揹著伺服器跑”的包袱。這一佈局若成功,輝達將從算力供應商延伸為機器人時代的平台標準制定者,深刻影響 AI 產業鏈上下游的競爭格局。不過,Cosmos 3 能否真正統一碎片化的機器人生態,仍需時間檢驗。