具身智慧創業企業星塵智慧在 7 月 15 日公佈了兩項重要技術成果:第二代具身基礎模型 Lumo-2,以及面向長期人機共處的物理 AI 智慧體 Philia。這兩者分別對應公司技術框架中的「AI 模型」與「具身 OS」層,與繩驅機器人本體共同構成完整的體系。

Lumo-2 的核心創新在於引入了一種類似「見聞色」的能力——在生成動作之前,模型會先在壓縮的隱空間中預測與任務相關的未來物理變化。傳統視覺-語言-動作(VLA)模型通常根據當前畫面和指令直接輸出動作軌跡,容易陷入「反射式」侷限,難以理解動作將如何改變環境。Lumo-2 則在觀察與動作之間插入了一層潛在世界動態預測,它不生成完整影片,而是聚焦於物體移動方向、接觸狀態、任務階段等與控制直接相關的資訊,形成一份面向行動的「未來草稿」。

這一設計讓 Lumo-2 在實際任務中展現出更強的適應性。例如在倒水任務中,透明液體倒出前後單幀影像極為相似,機器人僅憑當前畫面難以判斷應繼續傾倒還是放回容器。Lumo-2 通過引入短期動作歷史,讓模型結合此前行為判斷當前階段,從而避免狀態混淆。根據官方展示,該模型已能完成接住滾落的球、煎雞蛋顛鍋翻面、稱取 500 克小米、給禮盒打蝴蝶結等超過 22 項家庭任務,覆蓋動態場景、長流程、高精度靈巧操作等多個類別。

在訓練方法上,Lumo-2 採用了三階段漸進式訓練。第一階段讓動作與視覺世界變化對齊,從前後幀差異中篩選與物理運動相關的資訊;第二階段將動作與視覺、語言對齊,使動作表徵逐漸具備語義關係;第三階段聯合視覺語言資料、網際網路影片、人類第一人稱影片和機器人資料進行訓練,將動作視為基礎模型中的一種核心模態,而非視覺語言模型末端的附加輸出介面。為滿足即時控制需求,模型還採用分塊自迴歸生成方式,在單張 RTX 5090 上端到端延遲從約 253.66 毫秒降至 93.53 毫秒。論文資料顯示,Lumo-2 在未見語言指令和未見物體條件下,任務成功率均優於 π0.5 和 Fast-WAM 等基線模型。

與 Lumo-2 向下深入模型能力不同,Philia 向上構建了一套面向使用者體驗的智慧體系統。它通過Robot Gateway(機器人閘道器)將多台機器人的能力抽象為標準介面,使用者可在飛書、微信、語音等介面與同一個助理身份互動,系統負責理解意圖、呼叫記憶、拆解任務並分派給不同機器人執行。長期記憶功能讓 Philia 能記住使用者偏好,例如使用者說過早餐通常吃三明治和濃縮咖啡,後續只需說「把我平時早餐吃的食物放進托盤」,系統便能從記憶中檢索並執行。

這兩項釋出共同指向一個趨勢:具身智慧正從單次技能演示進入系統工程階段。僅靠一段漂亮的演示影片已不足以打動市場,一套可升級、可打斷、具備記憶且能對真實世界負責的完整系統,正逐漸成為機器人進入家庭場景的准入門檻。