7月30日,Google 通過更新 Gemini Robotics 開發者文件,正式開放新一代具身推理模型 Gemini Robotics ER 2 的預覽版。與行業常見的硬體釋出會不同,這次升級以近乎軟體更新的方式悄然出現在 Google AI StudioGemini API 中,開發者可直接呼叫兩個模型端點:一個面向常規具身推理任務,另一個面向即時音影片流和低延遲機器人智慧體。

ER 是 Embodied Reasoning(具身推理)的縮寫。Google 將 Gemini Robotics 系列大致分為兩層:VLA 模型負責將視覺資訊和指令轉化為機器人動作,解決“手腳怎麼動”;ER 模型負責理解環境、拆解任務、呼叫工具,並判斷機器人是否完成了當前步驟,解決“接下來該做什麼”。Google 官方將 ER 模型稱為機器人的“高層大腦”。

ER 2 建立在 Gemini 3.5 Flash 之上,新增或強化了多項關鍵能力:影片片段定位任務進度分類多機器人協同以及多步驟工具呼叫。它不再只回答畫面中有什麼,而是要從連續影片中判斷某個動作何時開始、執行到哪一步、是否成功以及是否需要重試。這直接針對機器人領域一個現實問題——規劃與執行容易脫節。模型可以生成一套看似合理的步驟,但真實世界不會嚴格按照計劃執行,杯子可能滑動,箱子可能被挪走,機械臂也可能抓取落空。ER 2 新增的影片進度理解,正是試圖補上這一環。

Google 同時推出了 gemini-robotics-er-2-streaming-preview,通過 Live API 持續接收音訊和影片流,並支援低延遲函式呼叫。相比“拍一張圖片、傳送一次請求、等待一個答案”的輪詢模式,流式模型讓機器人能夠保持與環境的連續連線,從觀察一個畫面走向觀察一個正在發生的過程。

儘管被稱作機器人的“大腦”,ER 2 並不是一套完整的機器人控制模型。它接收文本、影像、影片和音訊,輸出仍然是文本——可以給出物體座標、邊界框、任務步驟和工具呼叫指令,卻不會直接輸出電機控制訊號。開發者仍需將其與 VLA 模型、抓取模型、運動控制器以及機器人自身的硬體介面連線。Google 沒有試圖用一個端到端模型包辦機器人從理解到執行的全部環節,而是更接近在不同能力之間建立一層排程系統:上接語言和視覺模型,下接機械臂、感測器、控制演算法以及企業自定義的軟體工具。

這種架構給 Google 留下了更大的進入空間。機器人行業仍缺少統一硬體形態,人形機器人、輪式雙臂機器人、工業機械臂和四足機器人對動作模型和控制系統的需求差異明顯。若押注某一種本體,模型能夠覆蓋的市場也會受到限制。高層推理和任務排程卻具有更強的通用性。Google DeepMind 公開展示的 Gemini Robotics 能力已覆蓋 ALOHA 雙臂平台Franka 機械臂以及 Apptronik Apollo 人形機器人。官方對產品的表述也是面向“不同形狀和尺寸”的機器人,而非只服務於人形本體。

ER 2 還首次突出多機器人協同能力。在倉庫、工廠和商業空間中,任務往往需要由多種裝置共同完成:一台移動機器人負責運輸,一台機械臂負責裝卸,固定攝像頭提供環境資訊,另一台裝置負責掃描或質檢。傳統自動化系統可以依靠預設流程完成穩定任務,但一旦訂單、物料或環境發生變化,企業通常需要重新編寫規則。ER 2 試圖把自然語言理解、視覺判斷和工具呼叫放在同一層中,讓模型成為多台機器人之間的動態排程者。Google 將這項能力稱為“機器人智慧體編排”。這一步的商業價值可能比讓人形機器人完成某個炫目的單項動作更直接——今天已經進入工廠和倉庫的大量裝置並不缺少穩定執行單一動作的能力,真正制約自動化進一步擴充套件的,是裝置之間難以靈活協同,系統無法低成本處理頻繁變化的任務。

將 Google 的機器人戰略類比為 Android 很有吸引力,但現在下結論仍然過早。智慧手機擁有相對標準化的計算架構和互動方式,機器人面對的卻是高度複雜的物理世界。不同裝置在關節數量、負載能力、感測器配置、控制頻率和安全邊界上差別巨大,模型無法像手機應用一樣在不同本體之間直接複製。Google 自己也沒有掩飾當前模型的侷限:官方開發文件提示,複雜請求、高解析度輸入和更高的推理等級會增加延遲;模型可能產生幻覺;空間輸出會受到光照、對比度和提示詞質量影響。對於高精度任務,Google 甚至建議開發者多次呼叫模型並對結果取平均值。這些限制在聊天機器人中可能只是回答錯誤,進入物理世界後卻可能變成碰撞、物品損壞甚至人員風險。

ER 2 目前仍處於預覽階段,Google 尚未公開足夠完整的基準測試,也沒有披露其在真實商業場景中的長期執行資料。流式影片和音訊接入還帶來了新的資料問題:機器人在工廠、商場和家庭中執行時,可能持續採集人的聲音、面部和行為資訊。Google 已經在開發者條款中明確要求,當機器人可能採集可識別的個人資料時,運營方需要提前告知並獲得相關人員同意,同時儘量減少資料採集。在工廠等敏感場景中,客戶是否願意讓生產影片和任務資料持續進入外部模型,將直接影響 ER 2 的商業化速度。

過去兩年,中國具身智慧企業普遍強調全棧自研,從本體、關節、靈巧手到世界模型和 VLA,擁有完整技術鏈條被視為企業估值的重要支撐。Google 將 ER 能力以 API 形式開放後,這套敘事會面臨新的檢驗。當通用的空間理解、任務拆解、影片進度判斷和工具呼叫能力可以外購,機器人企業是否仍有必要從頭訓練一套相似模型?答案取決於企業真正擁有的壁壘。對於缺少模型團隊的本體廠商,呼叫 Google 等公司的基礎模型可以降低進入智慧機器人市場的門檻;對於擁有場景資料和客戶資源的企業,通用模型也可能幫助它們更快完成產品驗證。但外部模型不會消除機器人企業的價值——ER 2 能夠判斷“應該拿起哪個物體”,卻不直接解決機械臂能否穩定抓住;它可以生成任務計劃,卻無法替代企業對負載、速度、功耗和安全邊界的工程理解;它能夠接收工廠影片,也不會天然掌握某條產線多年積累的工藝資料。隨著基礎模型能力逐步成為公共供給,機器人企業需要重新回答一個問題:自己究竟在模型、本體、資料和場景中掌握了哪一項不可替代的能力。對中國企業而言,製造業場景和真實執行資料仍是重要籌碼。

從搜尋、手機到生成式 AI,Google 長期爭奪的都是人與計算系統之間的入口。機器人提供了一個新的介面。當計算從螢幕走向真實空間,使用者不再通過點選圖示呼叫服務,而是直接說出一個目標,由機器人觀察環境、理解意圖並完成任務。誰掌握這層理解和排程能力,誰就可能影響未來機器人如何連線搜尋、地圖、雲服務和其他數字工具。Gemini Robotics ER 2 已經支援 Google 搜尋函式呼叫程式碼執行等能力,機器人由此不再只是執行預先寫好的程式,它可以先查詢資訊,再結合現場環境制定行動方案。Google 真正想連線的,可能並非某一台機器人,而是數字世界和物理世界之間的呼叫鏈。從目前的能力看,ER 2 距離通用機器人“大腦”仍有明顯距離,但它已經給出了 Google 的選擇:與其加入本體公司的產能競賽,Google 更願意站在本體之上,為不同機器人提供觀察、判斷和排程能力。一旦這種分工成立,機器人企業負責製造身體,Google 則試圖決定身體如何理解世界。