2026 年 6 月,一家成立不到一年的紐約公司 General Intuition(通用直覺)完成了 3.2 億美元 的 A 輪融資,估值達到 23 億美元,領投方是矽谷知名投資人 Vinod Khosla。這家公司既不做大語言模型,也不造自動駕駛汽車,而是專注於構建一個通用的“機器人大腦”——一個能驅動機器人理解物理世界的基礎模型。

其核心主張極具顛覆性:訓練這樣的模型,不需要數百萬小時的真實機器人操作資料,用人類玩遊戲的幾百萬小時錄影就夠了。CEO Pim de Witte 在 TechCrunch 的播客中表示,許多公司目前專注於單個機器人、單個環境、單個任務的專項工作,這些努力很快會變得多餘。

傳統機器人訓練路徑以特斯拉的 FSD 車隊為代表,依賴海量真實路採資料與人工標註,成本高昂。特斯拉監督版全自動駕駛車隊累計行駛里程已突破 100 億英里,背後投入的資金堪稱天文數字。波士頓動力的 Atlas、Figure 的 Figure 01 等也遵循類似邏輯:先造硬體,再堆資料,緩慢迭代。General Intuition 則試圖徹底繞開這一過程。

該公司的技術思路是從遊戲錄影中提取“物理直覺”。遊戲畫面、手柄按鍵記錄和角色運動軌跡中蘊含著豐富的空間感、時間感與因果關係判斷。模型學習的不是如何通關,而是物體在空間中如何運動。公司聲稱,基於數百萬小時遊戲資料預訓練後,僅需 8 分鐘 的真實機器人資料微調,就能讓四足機器人在辦公室環境裡自主導航,且僅依靠一個前視攝像頭,無需雷射雷達或深度感測器,即可在動態人群中實現零樣本避障。

不過,這一“8 分鐘微調”的說法需要審慎看待。首先,該演示僅在結構化的辦公室環境中完成,在建築工地、家庭廚房等複雜場景下的泛化能力尚未公開驗證。其次,8 分鐘是微調時間,基礎模型的預訓練成本並未披露。再者,這屬於公司單方面宣告,缺乏第三方獨立測試。在物理 AI 領域,演示效果與量產落地之間往往存在巨大鴻溝。

Vinod Khosla 的押注並非偶然。他早年聯合創立 Sun Microsystems,2019 年又作為首位機構投資者押注 OpenAI,如今將目光轉向物理 AI。Khosla Ventures 今年以來已在機器人領域投資至少 5 家公司,General Intuition 是其中最大的一筆。他看中的是“機器人大腦”的平台化終局——不做機器人硬體,而是提供一個通用基礎模型,讓下一個造自動駕駛汽車的公司容易 10 倍。這一定位類似於當年 Android 不做手機只做作業系統,或 OpenAI 不做應用只提供 API。

但業內對“通用物理基礎模型”的質疑從未停止。核心爭議在於遊戲世界與現實世界之間的“Sim-to-Real Gap”:遊戲環境由確定性物理引擎驅動,而現實充滿隨機摩擦、氣流與不可預測的人類行為。如果遊戲資料真如此有效,擁有算力、資料和遊戲部門的 NVIDIAGoogleMeta 為何仍在重注模擬平台與真實資料採集?一個可能的答案是:遊戲資料是起點,而非終點。

從投資邏輯看,General Intuition 的估值建立在典型的“贏家通吃”賭注之上。如果物理 AI 基礎模型真的存在,先發者將享受類似 GPT-3 之後 OpenAI 的網路效應;如果不存在,公司可能一文不值。目前積極訊號包括 3.2 億美元現金儲備、實際機器人演示,風險則包括成立不足一年、無公開客戶、8 分鐘微調泛化能力未知、生態建設為零。與此同時,NVIDIA 的 Halos for Robotics 平台已擁有超過 40 家生態夥伴,Figure、1X 等也在探索通用模型,競爭正在逼近。

對中國物理 AI 產業而言,這一事件揭示了底座層競賽的開啟。國內玩家大致分為三類:場景驅動派、模擬平台派和基礎模型派,百度、華為、位元組以及智元機器人等初創公司均在探索。但現實挑戰清晰:算力受限導致訓練成本可能數倍於海外,一級市場資本密度難以匹配矽谷的燒錢規模。不過,中國製造業佔全球 30% 的場景密度提供了獨特優勢——在工業製造、物流倉儲等垂直領域,通過資料、模型、應用的閉環,完全可能建立起不可替代的垂直底座,而非追求一個大一統的通用模型。

General Intuition 的價值不在於它今天做到了什麼,而在於它提出了一個值得驗證的命題:物理 AI 能否像自然語言處理一樣,從專用模型走向通用基礎模型。2026 年下半年,物理 AI 的基礎模型卡位戰將全面打響,23 億美元估值是泡沫還是先見之明,12 個月內可見分曉。但可以確定的是,誰先在“通用物理直覺”上跑通,誰就可能定義下一代機器人的作業系統。