7月19日,2026世界人工智慧大會(WAIC)重點論壇“螞蟻集團·AGI基礎設施與普惠實踐論壇”在上海舉行。螞蟻靈波科技首席科學家沈宇軍在會上正式釋出靈波全棧2.0,系統闡釋了其“具身原生”技術路線。沈宇軍強調,物理世界與數字世界在感測誤差、環境隨機性和即時互動需求上存在本質不同,機器人需要面向真實世界重新構建感知、預測與操作能力,不能將具身智慧簡單理解為“帶有Physical標籤的數字智慧體”。

靈波全棧2.0的核心指標之一是推理速度。沈宇軍披露,螞蟻靈波最新具身動作模型推理頻率可達90-150Hz,集成了資料訓練、MoE架構、因果預訓練、視覺壓縮與動作對齊等能力。在現場演示中,機器人能夠應對桌面足球等存在隨機變數的任務,並根據球體運動進行即時反應。同時,機器人支援構型從9種擴充套件至近20種,覆蓋頭部、腰部、底盤、雙臂及靈巧手等更多自由度組合,以適應移動、彎腰、開門、抓取、精細操作等多樣化任務。沈宇軍指出,只有提升跨任務、跨構型的泛化能力,才能逐步攤薄部署和訓練成本,“商業的賬才算得過來”。

在感知層,團隊提出“看得更清楚”的研發框架,強化幾何與邊緣建模。沈宇軍以“玻璃門後的貓”為例解釋:視覺模型或許能識別出“門後有一隻貓”,但機器人必須同時理解玻璃門這一無法穿越的物理邊界,否則就可能直接撞向門體。為此,螞蟻靈波拋棄了傳統的DINO預訓練範式,從邊緣建模角度重新訓練視覺基礎模型,以提升機器人對空間邊界、物體距離及遮擋關係的判斷能力。據介紹,螞蟻靈波已與奧比中光開展合作,將相關深度感知模型搭載至相機產品中並實現工業部署。

商業化驗證方面,螞蟻靈波系統工程負責人王志勇透露,團隊正探索藥房分揀、物流分揀和商品分揀等場景。其中,機器人在國大藥房一家門店的分揀試點已“初步跑通”,但距離實現全鏈路自動化、穩定替代人工仍有較長距離。藥房場景看似標準化,實則充滿複雜性:一家藥店往往擁有三四千個SKU,藥品形態包括盒裝和軟包裝,貨架涉及背櫃、陰涼櫃等不同儲存空間。機器人在陰涼櫃取藥時,需連續完成開門、識別、定位、抓取、放置等動作,還要應對晝夜環境變化、貨品擺放變化和人為干擾。王志勇表示,“基礎模型決定智慧的上限,垂類後訓練決定智慧的下限”,團隊將基礎模型能力與行業場景真實資料、強化學習、硬體適配和業務Know-how結合,通過後訓練提升機器人在特定環境中的可靠性。

論壇圓桌環節,多位行業嘉賓對具身智慧落地給出了相對謹慎的判斷。原理靈機聯合創始人範浩強表示,機器人進入實際場景後,最難的往往不是“主流程”,而是難以窮盡的異常情況(即“異常流”),例如機器人能否進入狹窄通道、機械臂會不會與周邊貨架發生干涉、夾爪能否穩定抓住不同物體等。王志勇也坦言,80%甚至90%的問題其實都是工程問題,場景實踐的意義不只是獲取訂單或展示案例,更重要的是將資料、硬體適配、部署流程和異常處理能力沉澱為可複用的工具鏈。千尋智慧相關負責人以電池插拔和搬運任務為例稱,團隊曾花約半年時間嘗試在寧德時代工廠部署相關模型,部分場景準確率可達到“兩個9”,但傳統工業場景通常需要至少99.9%甚至接近99.995%的穩定性,且如果換一座工廠仍需投入同等人力和成本,商業模式就難以成立。

除具身智慧外,論壇還圍繞Agent、強化學習和開源生態展開討論。浙江大學博士生導師趙俊博表示,“所有的長程任務是一場大考”,當任務從幾十步延伸至數小時、數天乃至數週,模型的訓練機制、過程評估、記憶管理和工具呼叫能力都需要進一步提升。美團LongCat團隊主任研究員顧奇認為,未來模型與Agent框架將形成更深層次的協同設計。LobeHub創始人徐文彬則提出,Agent不僅要完成任務,更應具備自我驗證能力,在將結果交給使用者前主動判斷輸出是否正確並修正。