螞蟻靈波在一場溝通會上給出了對機器人大腦現狀的冷靜判斷:當前行業尚未迎來真正的智慧湧現,技術路線也遠未收斂。CEO朱興和首席科學家沈宇軍認為,機器人大腦可能還沒有走到GPT-1時刻。這一表態與市場對具身智慧的熱度形成反差,也引出了靈波此次一口氣釋出6款模型的核心意圖——不是堆砌數量,而是拆解機器人大腦仍未解決的單點問題。

靈波選擇從物理世界的約束出發,重做模型體系。沈宇軍用一個“開門見貓”的例子解釋了關鍵差異:一扇不透明的玻璃門後面有一隻貓,普通視覺模型能識別貓並描述畫面,但機器人向貓移動時,僅僅“看見”還不夠。它需要理解玻璃門構成了物理阻隔,在門開啟之前,貓處於機械臂無法觸達的空間。數字模型關注畫面裡有什麼,機器人還要判斷距離、遮擋、接觸關係和可達性。語義識別正確,只完成了物理任務的第一步。

與服務於內容創作的影片模型不同,機器人面對的時間只能向前流動。它抓取杯子時,不知道下一秒是否會有人碰到桌子,也不知道杯子會不會滑動。模型只能根據當前狀態預測下一步,並在感測器返回新資訊後修正動作。畫面是否漂亮並不重要,預測需要合理、快速,並且能夠轉化成動作。靈波將這條路線稱為“具身原生”,並從頭訓練LingBot-VA 2.0。公開技術論文顯示,該模型採用因果預訓練、稀疏MoE和非同步推理等設計,服務於高頻、閉環的機器人控制。這種取捨甚至允許預測畫面出現一定變形,只要動作方向正確,感測器會持續提供真實畫面供模型校準。

選擇具身原生路線,首要代價是一場資料長征。朱興直言,千萬小時資料可能也不夠自動駕駛面對相對明確的交通規則和駕駛任務,而通用機器人需要進入工廠、倉庫和家庭,接觸不同材質的物體,適配不同身體,還要處理事先無法定義的失敗狀態,資料分佈遠比單一駕駛任務複雜。公開論文顯示,LingBot-VLA 2.0的預訓練資料已從第一代的約2萬小時增至6萬小時,其中包括5萬小時機器人軌跡和1萬小時第一視角人類影片,覆蓋17家廠商的20種機器人構型。動作空間也從雙臂擴充套件到頭部、腰部、移動底盤和靈巧手。但6萬小時仍只是起點,靈波更看重資料閉環的速度和質量,下一階段還要補充觸覺、力覺等模態,並與第一視角影片對齊。

商業化層面,靈波把成功率放在速度之前。朱興指出,機器人動作再快,連續失敗幾次後企業仍要安排人員接管,部署難以產生經濟價值。成功率穩定之後,企業才會進一步計算節拍、推理效率和單位成本。基礎模型與後訓練由此形成分工:預訓練被比作培養一名基礎素質很好的大學生,後訓練則將其變成生產工具。基礎模型越聰明、見過的構型和任務越多,後訓練需要補的課就越少。靈波已表示正在與本體廠商推進產業落地,並探索買斷、訂閱和定製等收費方式,但現場未披露可供外界驗證的客戶案例、收入規模和成本模型。

從頭訓練機器人大腦需要長期投入,螞蟻給靈波提供的核心資源包括資金、人才、訓練基礎設施、資料處理能力和場景生態。靈波在此基礎上搭建從空間感知、影片生成、互動世界模型到VLA、VA的全棧模型體系。這套佈局反映了螞蟻對產業格局的判斷:具身智慧仍處於類似“百模大戰”的早期階段,未來可能收斂為少數幾家通用基礎模型提供商。機器人距離大規模進入家庭仍有很長距離,現在類比Windows或Android還太早。觀察螞蟻靈波2.0,更關鍵的指標是它能否持續提高跨任務、跨場景和跨構型的成功率,能否把後訓練成本降到客戶願意支付的水平。物理世界多了一層無法迴避的約束,模型做出的每一個判斷,最終都要由一副真實的身體完成。