8月19日下午,世界機器人大會分論壇“具身智慧大模型的進化之路:從技術分級到產業落地”在北人亦創國際會展中心舉行。生數科技創始人兼首席科學家、ACM/IEEE/AAAI Fellow朱軍發表主旨演講,釋出團隊最新研究成果,並系統闡述了通用世界模型的五級發展路線。
朱軍表示,從大模型發展的視角來看,團隊希望構建的不是服務於某個任務或場景的專用模型,而是能夠理解世界、預測未來並採取行動的通用基座模型。他強調,通用世界模型不是單一的生成器、模擬器、機器人動作模型或策略模型,也不是這些能力的割裂片段或簡單線性串聯,而是三種能力耦合在一起的閉環反饋系統——行動不僅是模型的輸出,還會改變環境、產生新資訊,並進入下一輪理解、預測和決策。
在資料方面,通用世界模型需要一個由觀察逐步走向行動的多層資料金字塔:從海量網路影片開始,逐步擴充套件到特定領域影片、第一視角人類影片、帶動作記錄的人類示範,以及真實機器人互動資料。越靠近底層,資料規模越大、覆蓋面越廣;越靠近頂層,資料更稀缺、成本更高,卻能更直接地建立任務、動作與物理結果之間的聯絡。合成數據可以貫穿每一層,同時“不完美資料”也具有重要價值——失敗嘗試、糾正動作和恢復過程都包含有效的學習訊號。
在架構層面,通用世界模型需要統一處理影像、影片、語言和機器人動作等不同模態資訊。生數科技提出的MoT(Mixture-of-Transformers)架構通過為不同模態配置專屬引數,並以共享注意力實現跨模態資訊互動,使環境理解、世界狀態預測與動作生成能在同一模型中協同完成。基於該架構的世界動作模型Motubrain,將理解、預測與行動統一建模,打破傳統分模組方案的能力割裂,同時提升異構資料利用效率和跨任務遷移能力。算力則同時影響大規模預訓練和即時部署——離線影片生成可容忍一定等待時間,但即時互動和機器人控制必須在環境變化前完成預測和決策,因此訓練基礎設施、推理加速、模型蒸餾和高效注意力機制都是重要支撐。
朱軍將通用世界模型劃分為五個逐級演進的層級,並指出生數科技過去幾年的研發與落地實踐已覆蓋前三個層級。L1世界生成,讓模型學會生成連貫的世界演化過程,影片是這一階段最典型的載體。2024年生數科技推出影片生成大模型Vidu,完成了L1階段的初步實踐。L2與世界互動,模型開始接收即時輸入,並根據語言、語音或控制訊號持續改變後續內容。2026年7月釋出的Vidu S1將這一能力推進到即時互動階段,使用者可通過語音即時介入生成過程。L3在世界中行動,模型從數字世界進入物理世界,環境理解、未來預測和動作生成真正統一。Motus於2025年12月釋出並全面開源;2026年4月釋出的Motubrain則進一步將環境理解、世界狀態預測和動作軌跡生成統一到同一模型中,推理速度較Motus提升約10倍,適配新機器人本體時僅需50至100條人類示範資料,在RoboTwin 2.0基準測試中得分96.1分,位居榜首。目前Motubrain已在包括銀河通用、星塵智慧、千尋智慧等近十種本體上完成驗證,展現出長程任務、多工場景和不同機器人形態之間的泛化能力。
L4自主世界智慧體要求模型具備真實行動能力後,進一步走向自主決策,能圍繞長期目標主動感知環境、拆解任務、探索未知狀態並持續規劃行動。L5世界組織者則不再只控制單個智慧體,而是統籌機器人、數字智慧體、人類、工具及其他資源,完成更復雜的任務分配與多智慧體協作。朱軍指出,從L1到L5能力層層遞進,沒有對世界演化規律的學習和預測,就難以形成穩定連續的互動;沒有真實行動帶來的環境反饋,也很難進一步發展出自主學習、長期規劃和複雜協同能力。
目前L1至L3已形成較為具體的技術實踐,但距離更高階的世界智慧仍有差距。影片模型仍需持續提升生成質量、可控性與時空一致性;世界動作模型則需在更復雜、更開放的真實環境中提升穩定性、泛化能力與執行效率。繼續邁向L4和L5,還需突破六項關鍵挑戰。生數科技表示,將持續強化世界生成、與世界互動、在世界中行動三個層級,並補齊目標形成、主動探索、持續學習和長期記憶等能力,為更高階的自主世界智慧體奠定基礎。更長遠的目標是構建一個能夠持續理解世界、預測不同行動後果、在明確約束下自主行動,並從真實反饋中不斷學習和進化的通用基座。當理解、預測與行動真正形成閉環,世界模型將不再只是生成內容的模型或執行任務的機器人策略,而會成為連線數字世界與物理世界、邁向通用具身智慧的重要基礎。