輝達於 2026 年 8 月 19 日釋出 Cosmos 3 Edge,這是一款專為機器人端側控制設計的 4B 引數 omni 模型,包含一個 2B 引數的 Nemotron 推理器。該模型屬於 Cosmos 3 系列,與 Cosmos 3 Nano 和 Cosmos 3 Super 使用相同的物理世界資料預訓練,因此具備對物體運動和互動的基礎理解。其關鍵優勢在於模型足夠小,可直接在輝達 Jetson Thor 上執行,無需依賴資料中心 GPU。
後訓練是使模型適應機器人操作任務的關鍵步驟。輝達提供了完整的教程,指導開發者將 Cosmos 3 Edge 後訓練為操作策略,並在 Jetson Thor 上部署。訓練資料來自 nvidia/Cosmos3-DROID 資料集,包含 7.6 萬條成功遙操作軌跡,約 350 小時,覆蓋 86 個任務和 564 個場景,使用 Franka Panda 機械臂和 Robotiq 夾爪採集。資料以 LeRobotDataset v3.0 格式提供,解析度為 640×360。訓練前需過濾空閒幀、選擇成功演示,並進行隨機裁剪、縮放和顏色抖動增強。
後訓練過程需要強大的計算資源。輝達驗證的配置使用 64 個節點,每個節點配備 4 塊 GB200,共 60K 次迭代,耗時約 68 小時,總計約 1.74 萬 GB200 小時。這屬於基礎模型後訓練,而非單 GPU 微調,開發者需提前規劃算力。訓練超引數包括:動作空間為 8 維絕對關節位置(7 關節 + 夾爪),觀測為三攝像頭畫布(腕部 360×640,兩個外部檢視 180×320),動作塊為 15 Hz 下 32 個未來動作,學習率 2e-4,全域性批大小 8192。
在 Jetson AGX Thor T5000 上,後訓練的策略模型能夠即時執行。推理時,模型生成一個動作塊約需 1.53 秒(640×540 解析度、15 Hz),而一個動作塊覆蓋約 2.13 秒的機器人運動。由於下一個動作塊在當前塊完成前已準備好,機械臂可連續運動,無需資料中心 GPU 介入。在閉環 RoboLab 任務中,該策略達到 22.9% 的成功率。這證明 4B 世界模型可以作為實用的即時端側策略骨幹。
輝達強調,Cosmos 3 Edge 支援多種機器人本體,包括雙臂 Franka、UR、WidowX 250 和 LeRobot SO101。開發者可將自有資料轉換為 LeRobot Dataset v3 格式,並針對不同本體配置動作空間、相機佈局和歸一化設定。教程中的所有步驟均可從開源 cosmos-framework 倉庫復現,釋出的檢查點已在 HuggingFace 上提供。
這一發布對機器人領域具有重要意義。世界模型此前因體積龐大難以在裝置端部署,而 Cosmos 3 Edge 通過後訓練實現了端側即時推理,降低了機器人對資料中心算力的依賴,可能推動具身智慧在邊緣場景的廣泛應用。對於 AI 產業投資者而言,這標誌著輝達在邊緣 AI 和機器人領域的佈局進一步深化,有望帶動相關硬體和軟體生態的發展。