OpenAI首席执行官山姆·奥特曼当地时间9月2日在《Sources》播客中首次明确表示,公司将亲自研发人形机器人,并同时探索其他形态的机器人。这一表态终结了外界长期以来的猜测,标志着OpenAI从机器人领域的“大脑”供应商,正式转向软硬件一体的整机玩家。
奥特曼在回答主持人提问时直言:“我们肯定会做人形机器人,也会做其他形态的机器人。”他解释,选择人形并非为了让机器人更像人类,而是因为现实世界——门把手、楼梯、键盘、厨房、汽车以及工厂设备——都是围绕人类身体尺寸和操作习惯建造的。与其改造物理环境,不如让机器人适应人类已有的世界。但他也强调,短期内OpenAI不会优先做家庭陪伴机器人,而是更关注工业基础设施,特别是能协助熟练工人建设、运营数据中心的机器人。奥特曼透露,公司还将研发适用于数据中心的特种机器人,根据具体任务采用不同身体结构。他认为,机器人最终长什么样并非关键,“真正重要的是如何造出让机器人工作的‘大脑’”。
这并非OpenAI首次涉足机器人。早在2017年,OpenAI就开始探索将虚拟环境中学到的技能迁移到现实世界,2018年其机器人手Dactyl能自主转动方块,2019年又训练机械手单手还原魔方,成为当时强化学习领域的明星项目。然而2020年前后,OpenAI解散了机器人团队,原因是数据太少——语言模型可从互联网获取海量文本,视觉模型能从图片视频学习,但机器人所需的动作数据昂贵且稀缺,每一次抓取、行走都涉及真实物理世界的摩擦、重量与误差,训练速度远不及纯数字模型。此后OpenAI将资源集中于大语言模型,并于2022年底推出ChatGPT。
六年过去,情况已变。多模态模型能同时理解文字、图片、视频和声音,视频生成模型开始学习物体运动规律,仿真、合成数据和远程操作等训练方式快速成熟,为机器人数据难题提供了新路径。OpenAI官网目前正招聘机器人软件、电气、固件和产品安全等方向的工程师,岗位覆盖电路设计、PCB、传感器、嵌入式系统、机器人控制、数据采集、故障处理和量产准备,部分岗位年薪最高达44.5万美元并含股权。这表明OpenAI要做的已不仅是通用模型,而是一套由模型、软件和硬件共同组成的完整机器人系统。
在决定自研之前,OpenAI曾以投资和合作方式布局机器人。2023年,OpenAI领投人形机器人公司1X的2350万美元融资,1X随后推出面向家庭场景的人形机器人NEO;2024年,OpenAI参与Figure的6.75亿美元融资并签署合作协议,计划将其多模态模型装入Figure人形机器人,双方曾展示机器人识别物品、交谈并递苹果的视频。但合作仅维持约一年,2025年2月Figure创始人布雷特·阿德科克宣布终止合作,转而自研端到端机器人模型,并推出Helix模型,强调硬件与AI必须联合训练。到2026年,阿德科克更直言Figure与OpenAI将成为竞争对手。如今奥特曼确认自研,OpenAI的身份已从幕后模型提供者变为直接参赛者,未来将面对的不只是Anthropic、谷歌、幻方量化等大模型公司,还包括特斯拉Optimus、Figure、1X以及宇树科技、优必选、智元机器人等已进入整机交付阶段的机器人企业。
人形机器人正成为AI巨头争夺的下一块高地。大模型目前主要存在于手机和电脑中,能写文章、生成代码,却难以直接改变物理世界;一旦模型拥有可行走、抓取的身体,AI才能真正进入工厂、仓库、数据中心和家庭。对OpenAI而言,机器人可能成为ChatGPT之后更大的入口。其优势在于全球领先的多模态模型、充足算力、资本和庞大用户基础,以及通过仿真和生成式模型制造训练数据的能力。但短板同样明显:人形机器人不是放大版ChatGPT,关节、电机、减速器、传感器、整机散热、实时控制和安全冗余都需要长期积累。演示视频中完成一次任务不难,难的是连续工作数小时、面对陌生环境保持稳定且成本足够低。特斯拉、Figure、宇树、智元等已在硬件、供应链和真实场景中积累多年,OpenAI拥有强大的“大脑”,但能否造出可靠、灵活且可量产的“身体”仍是未知数。
截至目前,OpenAI尚未公布人形机器人的名称、外观、技术参数、原型机或量产时间表。奥特曼的表态代表战略方向,并不意味着产品临近发布。但他曾表示希望未来每个人都拥有一台个人机器人,替人完成不愿做的工作。ChatGPT让OpenAI进入了数亿人的电脑和手机,这一次,它想走进工厂、数据中心,最终走进每个人的家。