具身智慧公司Generalist最新發布的GEN-1.5基座模型,展示了讓機器人研究者興奮的新能力:只需看一次3到12秒的示範,機器人就能在物體位置和初始狀態變化的情況下嘗試執行一項新任務,全程無需微調、不更新任何引數。在10項新任務上,這種“一次提示”的平均成功率達到59%;若提供約5分鐘資料並調整10次引數,成功率可提升至83%。曾參與Google DeepMind Gemini Robotics的研究者Ted Xiao將這種“看一次示範就學會新任務”的能力稱為機器人領域追尋多年的“聖盃”,並稱GEN-1.5是這條路線迄今最好的結果,那種能力突然躍升的感覺讓他想起第一次使用GPT-3。

Generalist將這一能力稱為“physical prompting”(物理提示),類比給大語言模型一段prompt:示範並未被訓練進模型,只是臨時告訴它“這一次要做什麼”。在演示中,機器人先學會用刷子把積木掃進碗裡,隨後研究人員換成香蕉,機器人竟能抓著香蕉橫貼桌面繼續掃;再換成簸箕時,它沒有照搬“掃”的動作,而是伸出另一隻手把積木推上簸箕再倒進碗——而它從未被教過用香蕉和簸箕。這種從大規模人類操作資料中天然存在的重複、失誤與恢復中學習的能力,被視作智慧湧現的跡象。

GEN-1.5還展示了三種學習新能力的方式:面對沒見過的變化(如碗被紙蓋住)直接泛化;看一次示範即開始新任務;用幾分鐘資料快速穩定新任務。物理提示還可以組合,將兩個示範接成連續動作,並補上示範中沒有的調整位置、換手和重新抓取。模型以100Hz輸出動作軌跡,在執行中持續觀察和修正,示範被放進30秒的上下文視窗

Generalist成立於2024年,三位聯合創始人中Pete Florence和Andy Zeng來自Google DeepMind(參與過PaLM-E、RT-2),Andrew Barry曾是Boston Dynamics資深研究員。公司不生產明星人形機器人,而是訓練可適配不同機械臂、夾爪和工具的底層智慧。其技術路線核心是scaling:2025年11月GEN-0用27萬小時真實操作資料證明物理資料可以scaling;2026年4月GEN-1在資料超50萬小時後,將簡單任務平均成功率從64%推至99%;此次GEN-1.5將新任務所需引數調整從數百次壓縮到數十次、10次、1次,最終歸零。

Generalist的資料採集不走傳統遙操作,而是採用類似UMI的低成本手持“機器人手”在家庭、倉庫和工廠中採集,已部署數千套硬體,訓練系統一天可讀取相當於6.85年的人類操作經驗。公司披露GEN-1約99%引數從頭訓練,不依附Gemini、GPT等預訓練模型。今年6月,Generalist完成4億美元融資,累計融資超5億美元,估值達20億美元,Radical Ventures領投,輝達、Bezos Expeditions、8VC等參投。

儘管一次提示59%的成功率尚不足以部署,但行業更看重其scaling曲線:隨著物理經驗增加,新任務所需專門訓練正趨近於零。輝達機器人研究負責人Jim Fan認為,資料中保留的“失誤—修正—繼續”過程可能是GEN-1.5會恢復和換辦法的重要原因。Generalist未公佈GEN-1.5的引數規模與完整訓練配方,但業界已將其視為機器人領域逼近“GPT-3時刻”的標誌性事件。