谷歌DeepMind于7月31日发布其最新视觉-语言-动作(VLA)模型Gemini Robotics 2,宣称这是迄今最先进的同类模型,能够控制从桌面机械臂到全身人形机器人的各种机器人形态。VLA模型结合图像识别、语言处理与动作控制,使机器人能够在物理环境中执行任务。DeepMind将Gemini Robotics 2描述为新一代自适应机器人的“智能层”,据称可管理全身运动、执行精细操作任务,并协调多台机器人协同工作。开发者现可通过候补名单申请早期访问权限。

同时,谷歌DeepMind还推出了Gemini Robotics ER 2,这是一个专为“具身推理”设计的模型,即理解物理世界并根据该信息决定采取何种行动。ER 2作为机器人的更高层级控制系统,取代了4月发布的Gemini Robotics ER 1.6。新模型现已在Google AI Studio中提供。

此次发布标志着谷歌在机器人AI领域的持续加码。VLA模型被视为机器人智能化的关键路径,其发展直接关系到机器人能否在复杂真实环境中灵活应对。Gemini Robotics 2的推出,意味着谷歌正试图为不同形态的机器人提供统一的智能基础,从工业场景的机械臂到服务场景的人形机器人,都可能受益于这一技术。

从产业角度看,这一进展可能对机器人硬件制造商、AI模型提供商以及下游应用开发者产生连锁影响。更强大的VLA模型有望降低机器人编程的复杂度,推动机器人更广泛地进入制造业、物流、家庭服务等领域。同时,谷歌将ER 2开放于AI Studio,降低了开发者实验和部署的门槛,可能加速生态系统的形成。

不过,目前该模型仍处于早期访问阶段,实际性能与可靠性尚待验证。机器人技术从实验室到大规模商用仍面临成本、安全性和环境适应性等挑战。谷歌DeepMind此次发布,无疑为机器人AI赛道注入了新的变量,其后续进展值得产业观察者持续关注。