2026年世界人工智慧大會(WAIC)上,它石智航成為展區焦點。這傢俱身智慧公司不僅把一條1:1還原的環形線束流水線搬進展館,還讓多台機器人叢集協作,在同一產線上同時裝配不同線束線型。支撐這套全自動化產線的,是它石智航剛剛釋出的具身原生基座模型AWE 3.5

AWE 3.5的命名暗示了其定位——它石希望這款模型能像GPT-3.5一樣,在多工能力上展現新的可能性。與上一代相比,3.5版本開始向更多場景溢位:工業裝配、插接、收納等任務全部被放進同一個模型裡,任務之間無需重新載入新模型或切換引數。展台現場,機器人展示了整理桌面、打包手機、插網線、零件分揀等多種操作,觀眾戴上資料採集夾爪後,還能與一個由AWE 3.5生成的平行世界互動——捏積木、拖拽手機盒、蠟燭火焰等物理反饋均由模型從真實類資料中學到,沒有一行牛頓定律程式碼或碰撞引擎。

在技術架構上,AWE 3.5從預訓練階段就開始將視覺、語言、動作等多種模態一起餵給模型,同一套架構既能輸出動作,也能預測未來。這種設計的關鍵在於:模型本身不變,只改變輸入輸出的組合方式,就能切換出不同的“人格”。視覺到動作的路徑形成Base Policy(基礎策略),負責制定指令;以動作為條件預測未來視覺的路徑形成Action Condition World Model(動作條件世界模型),負責預測環境變化。兩者互動構成一套完整的強化學習閉環。

它石智航CEO丁文超在採訪中解釋,AWE 3.5最核心的突破是讓模型成為自己的“模擬器”,無需手工搭建模擬環境。預訓練建立通用物理互動能力,後訓練在模型內部的世界裡自我對弈、自我強化,形成自閉環。這一範式在語言模型領域已被驗證,但在具身原生模型裡,AWE 3.5是第一家完整跑通的。

針對具身資料採集的難題,丁文超表示,它石的資料系統重心正從“更多”轉向“更聰明、質量更高”,Data Efficiency(資料效率)正在成為新的評測維度。目前預訓練已足夠紮實,一個新任務只需要小時級別的資料採集就能跑通。除線束裝配外,柔性操作、分揀、檢測協同等多個工業場景也已在驗證中。

丁文超還指出,具身智慧的Scaling已經解鎖。通過合理的預訓練與後訓練範式,完成新任務所需的資料量和採集成本已降到最低。他預測,2026年底到2027年可能會出現行業分水嶺,屆時“能否實現多場景可靠落地”將成為關鍵評判標準。如果一家企業能用AI化的方法實現多場景規模化落地,就會迅速與其他公司拉開差距。

關於行業路線之爭,丁文超認為,真正訓模型的人並不在乎所謂的VLA或世界模型之爭。他解釋,VLA架構中視覺和語言在預訓練階段緊密耦合,動作模態卻要到後訓練才接入,導致理論與實操之間存在先天裂縫;而世界模型路線雖然利用影片學習表徵,但網際網路影片模型的Attention結構已在大量通用影片上定型,直接嵌入具身基座模型容易走向極端。AWE 3.5的架構設計則從一開始就避免了這些問題。

在硬體方面,它石智航從AWE 3.0之前就開始自研靈巧手,採用Top-Down思路:先梳理需要完成哪些人類動作、匹配哪些人類資料,再反向定義硬體設計。丁文超認為,靈巧手能否真正勝任實際任務並跑通商業閉環,很可能成為具身智慧領域的一個重要里程碑。

對於新入局者,丁文超表示,只憑幾篇論文就想創業的難度已經非常高。具身智慧正在從區域性的技術亮點走向系統化的體系作戰,新公司需要尋找差異化的生態位,例如定位為通用世界模型公司,或避開已經高度內卷的桌面級任務,直接選擇全尺寸人形等方向。

展望未來12個月,丁文超預計機器人會真正進入更多大眾可觸達的場景,雖然進入家庭仍存在差距,但機器人將開始承擔更多真實的商業任務。到那時,評判標準會變得非常直觀:機器人到底完成了哪些事情?擴充套件新任務的速度有多快?成本有多低?這非常類似自動駕駛早期的發展軌跡——各家公司先圈定幾條演示路線,隨後開始比拼“開城速度”,最終進入存量競爭和大規模量產階段。