在WRC 2026大會上,星動紀元創始人兼CEO陳建宇提出,世界模型可能不僅是VLA的增強模組,而可能成為下一代具身智慧的核心範式。他認為,機器人要真正進入物流、服務乃至家庭等開放場景,必須從“模仿人類動作”轉向“理解物理世界規律”,而世界模型正是實現這一跨越的關鍵。

陳建宇將具身大模型的迭代歸納為三個範式:第一範式是語言模型加機器人控制,以ChatGPT出現為起點,但仍是模組化架構,無法端到端訓練;第二範式是多模態底座上的VLA模型,約在2023年GPT-4出現後興起,將視覺、語言和動作融合進統一模型,典型代表包括Google的PaLM系列和RT系列;第三範式則是世界模型,以2024年釋出的Sora第一代為標誌,具身智慧據此發展出“世界動作模型”,不僅能預測動作,還能預測未來世界狀態的演化,形成閉環。

陳建宇指出,VLA的侷限不在端到端訓練本身,而在其學習方式——幾乎全靠模仿人類行為資料,遇到新任務時泛化能力有限。而世界模型構建的是對物理世界的常識性理解,例如“水杯倒水水會往下流”這類常識無需反覆學習,因此天然具備更好的泛化性。他進一步強調,世界模型的智慧底座是影片模型,直接處理原始影像、影片、音訊資料,包含更豐富的物理細節,比以語言為底座的多模態模型更適合面向物理世界操作的具身智慧。

星動紀元早在2024年就發表了全球首個融合影片預測與動作預測的世界動作模型,比輝達的類似方案早了約一年。在資料層面,公司構建了基於大規模人類行為的資料集,並加入第一人稱人類操作資料;還與Facebook AI團隊的Andreas合作完成ControlNet相關工作,提升動作精準可控性,並將世界模型放入真實世界用真實反饋迭代。

陳建宇展示了模型的多項能力:世界模型能精準預測複雜物理現象,生成的影像與真實實拍幾乎無法分辨;在零樣本任務泛化上,模型能在辦公區隨機場景中完成“把左邊的拖鞋放到右邊拖鞋旁邊”等帶邏輯推理的指令;經過後訓練,模型還能完成疊紙盒、翻襪子、脫鞋、開水等精細操作,並具備跨本體能力,能操作靈巧手使用螺釘槍、移液器等工具。

在硬體層面,星動紀元堅持軟硬一體全棧自研,從整機、關節模組、機械手到電機、減速器、驅動器均自主開發。公司推出了全球首個面向商用的人形機器人複雜地形方案,2023年底已實現涉水行走、上下樓梯,今年春節期間還發布了全尺寸人形機器人舞劍演示。其靈巧手採用全直驅方案,響應速度極快,一秒鐘可點選10次滑鼠,負載達24千克。

商業化方面,陳建宇認為今年具身行業已進入拐點。星動紀元從物流工業起步,B端客戶專案已覆蓋十餘個城市,在物流分揀等場景常態化運作,同時開放硬體本體、API和軟體工具鏈供二次開發。他強調,通用機器人是一個持續進化的系統,大腦、本體和場景協同形成飛輪,隨著能力提升不斷開拓新場景,飛輪將越轉越快。