OpenAI執行長山姆·奧特曼當地時間9月2日在《Sources》播客中首次明確表示,公司將親自研發人形機器人,並同時探索其他形態的機器人。這一表態終結了外界長期以來的猜測,標誌著OpenAI從機器人領域的“大腦”供應商,正式轉向軟硬體一體的整機玩家。

奧特曼在回答主持人提問時直言:“我們肯定會做人形機器人,也會做其他形態的機器人。”他解釋,選擇人形並非為了讓機器人更像人類,而是因為現實世界——門把手、樓梯、鍵盤、廚房、汽車以及工廠裝置——都是圍繞人類身體尺寸和操作習慣建造的。與其改造物理環境,不如讓機器人適應人類已有的世界。但他也強調,短期內OpenAI不會優先做家庭陪伴機器人,而是更關注工業基礎設施,特別是能協助熟練工人建設、運營資料中心的機器人。奧特曼透露,公司還將研發適用於資料中心的特種機器人,根據具體任務採用不同身體結構。他認為,機器人最終長什麼樣並非關鍵,“真正重要的是如何造出讓機器人工作的‘大腦’”。

這並非OpenAI首次涉足機器人。早在2017年,OpenAI就開始探索將虛擬環境中學到的技能遷移到現實世界,2018年其機器人手Dactyl能自主轉動方塊,2019年又訓練機械手單手還原魔方,成為當時強化學習領域的明星專案。然而2020年前後,OpenAI解散了機器人團隊,原因是資料太少——語言模型可從網際網路獲取海量文本,視覺模型能從圖片影片學習,但機器人所需的動作資料昂貴且稀缺,每一次抓取、行走都涉及真實物理世界的摩擦、重量與誤差,訓練速度遠不及純數字模型。此後OpenAI將資源集中於大語言模型,並於2022年底推出ChatGPT。

六年過去,情況已變。多模態模型能同時理解文字、圖片、影片和聲音,影片生成模型開始學習物體運動規律,模擬、合成數據和遠端操作等訓練方式快速成熟,為機器人資料難題提供了新路徑。OpenAI官網目前正招聘機器人軟體、電氣、韌體和產品安全等方向的工程師,崗位覆蓋電路設計、PCB、感測器、嵌入式系統、機器人控制、資料採集、故障處理和量產準備,部分崗位年薪最高達44.5萬美元並含股權。這表明OpenAI要做的已不僅是通用模型,而是一套由模型、軟體和硬體共同組成的完整機器人系統。

在決定自研之前,OpenAI曾以投資和合作方式佈局機器人。2023年,OpenAI領投人形機器人公司1X2350萬美元融資,1X隨後推出面向家庭場景的人形機器人NEO;2024年,OpenAI參與Figure6.75億美元融資並簽署合作協議,計劃將其多模態模型裝入Figure人形機器人,雙方曾展示機器人識別物品、交談並遞蘋果的影片。但合作僅維持約一年,2025年2月Figure創始人佈雷特·阿德科克宣佈終止合作,轉而自研端到端機器人模型,並推出Helix模型,強調硬體與AI必須聯合訓練。到2026年,阿德科克更直言Figure與OpenAI將成為競爭對手。如今奧特曼確認自研,OpenAI的身份已從幕後模型提供者變為直接參賽者,未來將面對的不只是Anthropic、谷歌、幻方量化等大模型公司,還包括特斯拉Optimus、Figure、1X以及宇樹科技、優必選、智元機器人等已進入整機交付階段的機器人企業。

人形機器人正成為AI巨頭爭奪的下一塊高地。大模型目前主要存在於手機和電腦中,能寫文章、生成程式碼,卻難以直接改變物理世界;一旦模型擁有可行走、抓取的身體,AI才能真正進入工廠、倉庫、資料中心和家庭。對OpenAI而言,機器人可能成為ChatGPT之後更大的入口。其優勢在於全球領先的多模態模型、充足算力、資本和龐大使用者基礎,以及通過模擬和生成式模型製造訓練資料的能力。但短板同樣明顯:人形機器人不是放大版ChatGPT,關節、電機、減速器、感測器、整機散熱、即時控制和安全冗餘都需要長期積累。演示影片中完成一次任務不難,難的是連續工作數小時、面對陌生環境保持穩定且成本足夠低。特斯拉、Figure、宇樹、智元等已在硬體、供應鏈和真實場景中積累多年,OpenAI擁有強大的“大腦”,但能否造出可靠、靈活且可量產的“身體”仍是未知數。

截至目前,OpenAI尚未公佈人形機器人的名稱、外觀、技術引數、原型機或量產時間表。奧特曼的表態代表戰略方向,並不意味著產品臨近釋出。但他曾表示希望未來每個人都擁有一台個人機器人,替人完成不願做的工作。ChatGPT讓OpenAI進入了數億人的電腦和手機,這一次,它想走進工廠、資料中心,最終走進每個人的家。