具身智能公司Generalist最新发布的GEN-1.5基座模型,展示了让机器人研究者兴奋的新能力:只需看一次3到12秒的示范,机器人就能在物体位置和初始状态变化的情况下尝试执行一项新任务,全程无需微调、不更新任何参数。在10项新任务上,这种“一次提示”的平均成功率达到59%;若提供约5分钟数据并调整10次参数,成功率可提升至83%。曾参与Google DeepMind Gemini Robotics的研究者Ted Xiao将这种“看一次示范就学会新任务”的能力称为机器人领域追寻多年的“圣杯”,并称GEN-1.5是这条路线迄今最好的结果,那种能力突然跃升的感觉让他想起第一次使用GPT-3。
Generalist将这一能力称为“physical prompting”(物理提示),类比给大语言模型一段prompt:示范并未被训练进模型,只是临时告诉它“这一次要做什么”。在演示中,机器人先学会用刷子把积木扫进碗里,随后研究人员换成香蕉,机器人竟能抓着香蕉横贴桌面继续扫;再换成簸箕时,它没有照搬“扫”的动作,而是伸出另一只手把积木推上簸箕再倒进碗——而它从未被教过用香蕉和簸箕。这种从大规模人类操作数据中天然存在的重复、失误与恢复中学习的能力,被视作智能涌现的迹象。
GEN-1.5还展示了三种学习新能力的方式:面对没见过的变化(如碗被纸盖住)直接泛化;看一次示范即开始新任务;用几分钟数据快速稳定新任务。物理提示还可以组合,将两个示范接成连续动作,并补上示范中没有的调整位置、换手和重新抓取。模型以100Hz输出动作轨迹,在执行中持续观察和修正,示范被放进30秒的上下文窗口。
Generalist成立于2024年,三位联合创始人中Pete Florence和Andy Zeng来自Google DeepMind(参与过PaLM-E、RT-2),Andrew Barry曾是Boston Dynamics资深研究员。公司不生产明星人形机器人,而是训练可适配不同机械臂、夹爪和工具的底层智能。其技术路线核心是scaling:2025年11月GEN-0用27万小时真实操作数据证明物理数据可以scaling;2026年4月GEN-1在数据超50万小时后,将简单任务平均成功率从64%推至99%;此次GEN-1.5将新任务所需参数调整从数百次压缩到数十次、10次、1次,最终归零。
Generalist的数据采集不走传统遥操作,而是采用类似UMI的低成本手持“机器人手”在家庭、仓库和工厂中采集,已部署数千套硬件,训练系统一天可读取相当于6.85年的人类操作经验。公司披露GEN-1约99%参数从头训练,不依附Gemini、GPT等预训练模型。今年6月,Generalist完成4亿美元融资,累计融资超5亿美元,估值达20亿美元,Radical Ventures领投,英伟达、Bezos Expeditions、8VC等参投。
尽管一次提示59%的成功率尚不足以部署,但行业更看重其scaling曲线:随着物理经验增加,新任务所需专门训练正趋近于零。英伟达机器人研究负责人Jim Fan认为,数据中保留的“失误—修正—继续”过程可能是GEN-1.5会恢复和换办法的重要原因。Generalist未公布GEN-1.5的参数规模与完整训练配方,但业界已将其视为机器人领域逼近“GPT-3时刻”的标志性事件。