谷歌DeepMind於7月31日釋出其最新視覺-語言-動作(VLA)模型Gemini Robotics 2,宣稱這是迄今最先進的同類模型,能夠控制從桌面機械臂到全身人形機器人的各種機器人形態。VLA模型結合影像識別、語言處理與動作控制,使機器人能夠在物理環境中執行任務。DeepMind將Gemini Robotics 2描述為新一代自適應機器人的“智慧層”,據稱可管理全身運動、執行精細操作任務,並協調多台機器人協同工作。開發者現可通過候補名單申請早期訪問許可權。

同時,谷歌DeepMind還推出了Gemini Robotics ER 2,這是一個專為“具身推理”設計的模型,即理解物理世界並根據該資訊決定採取何種行動。ER 2作為機器人的更高層級控制系統,取代了4月釋出的Gemini Robotics ER 1.6。新模型現已在Google AI Studio中提供。

此次釋出標誌著谷歌在機器人AI領域的持續加碼。VLA模型被視為機器人智慧化的關鍵路徑,其發展直接關係到機器人能否在複雜真實環境中靈活應對。Gemini Robotics 2的推出,意味著谷歌正試圖為不同形態的機器人提供統一的智慧基礎,從工業場景的機械臂到服務場景的人形機器人,都可能受益於這一技術。

從產業角度看,這一進展可能對機器人硬體製造商、AI模型提供商以及下游應用開發者產生連鎖影響。更強大的VLA模型有望降低機器人程式設計的複雜度,推動機器人更廣泛地進入製造業、物流、家庭服務等領域。同時,谷歌將ER 2開放於AI Studio,降低了開發者實驗和部署的門檻,可能加速生態系統的形成。

不過,目前該模型仍處於早期訪問階段,實際效能與可靠性尚待驗證。機器人技術從實驗室到大規模商用仍面臨成本、安全性和環境適應性等挑戰。谷歌DeepMind此次釋出,無疑為機器人AI賽道注入了新的變數,其後續進展值得產業觀察者持續關注。