2026年9月9日,來自北京海淀中關村的深度機智正式釋出物理基座模型PhysBrain 1.5,在28項公開基準上取得72.5的綜合均分,位居參評開源模型首位。這一成績與頭部閉源模型GPT-6 Astra(73.3)、Gemini 3.6 Flash(73.0)的差距已收窄到1分以內。
評測覆蓋五大能力維度:視覺空間感知、空間與多視角理解、具身認知與規劃、空間指向與可供性、視覺軌跡推理。PhysBrain 1.5-8B在28項中拿下14項開源第一、10項開源第二,相較最強開源對手Hy-Embodied-VLM-1.0(66.0)高出約6.5分,較RynnBrain 1.1(63.1)高出9.4分。細分專案中,RoboSpatial-Home空間理解取得73.9分,Part-Affordance可操作部位識別84.0分,RoboRefit視覺目標定位89.8分。
這一結果的背景,是通用大模型在具身操作上暴露出的邊界。Google DeepMind於2026年7月30日釋出Gemini Robotics 2,基於Gemini 3.5 Flash構建具身推理大腦ER 2;OpenAI的GPT-6則在推理、程式設計與多模態理解上再度突破。Robocurve的一項實驗把GPT-6 Astra部署在真實機械臂上,在20次「積木放入碗」任務中完成19次,而Claude Fable 5.1僅完成8次;但在「藍色拼圖塊對位插入凹槽」這類毫米級精細任務上,GPT-6 Astra的成功率從95%掉到10%。這說明通用理解能力可以跨越「看懂」到「粗動作」的鴻溝,卻在精細接觸與精準插入面前止步。
深度機智選擇的路線並非比拼引數規模,而是把物理智慧基礎模型能力作為核心戰略方向。其提出的Physical Loop(物理智慧迴圈)統一架構,把「觀察世界—理解空間與任務—判斷動作後果—執行—反饋修正」五步原本分散在不同模型中的能力,重新組織進同一個基座模型。過去物理AI系統普遍採用「理解模型+動作模型+預測模型」的拼接方案,每個子模型都需單獨訓練與調優;PhysBrain 1.5則基於開源基礎模型,將語言回答、空間座標、動作軌跡、未來畫面與深度預測納入同一套訓練框架,使具身理解、動作生成與未來狀態預測彼此約束、協同演進。
資料來源是這條路線的基礎。團隊在論文中明確,物理感知的預訓練監督完全來自人類互動影片:通過全景影片記錄任務執行時的周圍環境,並同步保留全身姿態、手部運動與任務級語音,使一段互動不只是孤立的動作片段,而帶有連續的任務、動作與狀態變化上下文。連線人類資料與動作模型的是Human-as-Humanoid框架,它把人類行為資料從「可觀看的記錄」轉化為「可訓練的資源」。在此前研究中,這條轉換鏈路已延伸到自研的60自由度擬人體機器人Prime U,原始示範吞吐量達到傳統遙操作的4.8至7.2倍,並在部分任務上實現從人類資料到真機執行的零樣本遷移。
模型能力之外,PhysBrain 1.5同步開放了2B與8B兩檔引數規模。2B版本按官方評測規則僅作參考、不參與開源排名,但其66.6的綜合得分已超過表中所有其他非PhysBrain開源參評模型,包括30A3B規模的Hy-Embodied-VLM-1.0(66.0)、8B的Embodied-R1.5(64.9)和9B的RynnBrain 1.1(63.1)。兩個版本均已上線Hugging Face,技術報告、模型權重與評測工具包全部向社群開放。上線僅3天,PhysBrain 1.5獲得超過3k的下載量。
從產業視角看,這條新聞值得關注的並非單一分數,而是路線選擇本身。多數參與者預設物理智慧是「大模型順手能做好的延伸」,先把語言能力推到極致,再給模型接上動作輸出。GPT-6 Astra的機械臂實驗既展示了通用基礎模型提升可轉化為物理行動能力,也暴露了其在精細操作上的侷限,側面說明物理智慧需要專門的基礎模型。深度機智自2025年10月釋出《源於人,超越人》技術路線圖起,即把「人類學習」作為物理通用智慧的核心研發路徑,圍繞以人類資料為起點、以動作為中心建模、身體為AI設計三大戰略展開資料、模型、本體全棧佈局。
政策與行業層面亦有呼應。2026年7月,深度機智創始人陳凱博士在WAIC 2026具身智慧空間互動論壇上,以《人類學習範式:物理通用智慧遠征的起點》為題闡述相關技術判斷;9月10日,國家資料局黨組書記、局長劉烈宏主持召開具身智慧座談會,深度機智受邀出席並展示人類全景真實資料與情境數採(In Context Data Collection)範式。從2025年12月提出情境數採範式,到2026年7月迭代出全景數採範式,該公司在半年多時間內推進了資料採集能力與模型驅動的全自動標註管線。
整體來看,PhysBrain 1.5的登頂標誌著具身基座模型的競爭正從單項能力較量轉向系統能力對決,而開源權重與評測工具包的開放,也為全球開發者提供了在統一基座上驗證與二次開發的入口。這條路線能否在真實機器人任務中持續兌現,仍有待更大規模的真機資料檢驗。