机器人初创公司 Generalist AI 于 8 月 20 日发布了新一代 AI 模型 GEN-1.5,宣称该模型能让机器人仅凭一段 3 至 12 秒的演示视频学会新任务,且无需任何额外训练。这一进展若得到验证,可能显著降低机器人技能获取的门槛,推动具身智能从实验室走向实际应用。
据公司介绍,GEN-1.5 的工作方式是将演示视频作为“物理提示”加载到模型的上下文窗口中,相当于模型的短期记忆。之后,机器人即可直接执行任务,无需再经过传统意义上的训练过程。在开罐、从钱包取钱等十项测试中,公司报告的平均成功率为 59%;而如果提供五分钟的数据并进行十步训练,成功率则跃升至 83%。此外,该模型还能将两个提示串联成更长的序列,利用仿真环境中的演示,并部分模仿人类的手部动作。
值得注意的是,Generalist AI 声称这些能力并非通过显式编程或针对性训练获得,而是在超过八个月的预训练过程中,基于交互数据自发涌现的。这一说法与当前 AI 领域对“涌现能力”的讨论相呼应——即模型在规模扩大和训练数据增多后,会表现出训练目标之外的新能力。
事实上,其他研究团队此前也展示过类似的上下文学习能力,但大多局限于少数几种任务类型。Generalist AI 则宣称自己是首个让这种能力在广泛任务范围内奏效的团队。如果这一说法成立,意味着机器人不再需要为每个新任务重新收集数据、重新训练,而是可以像人类一样,通过观察一次示范就快速掌握新技能。
不过,需要保持审慎的是,目前展示的任务都较为简单和短促,且所有测试结果均来自公司自身,尚未经过任何独立机构的验证。在机器人领域,从演示到可靠执行之间往往存在巨大鸿沟,实验室中的成功率与实际部署环境中的表现可能相去甚远。此外,59% 和 83% 的成功率也意味着仍有相当比例的失败情况,这对于需要高可靠性的工业场景而言,可能仍是关键瓶颈。
从产业角度看,Generalist AI 的定位是“通用型机器人 AI”,其技术路径与当前主流的“大模型 + 机器人”趋势一致。若 GEN-1.5 的能力得到进一步验证和扩展,它可能对机器人本体制造商、系统集成商以及下游应用方(如仓储、制造、家庭服务)产生连锁影响——降低技能迁移成本,意味着机器人部署的边际成本有望下降,从而加速机器人在更多场景的渗透。
当然,对于投资者而言,仍需关注该技术的可扩展性、实际部署中的鲁棒性,以及是否有第三方复现其成果。在具身智能赛道竞争日益激烈的当下,任何“单次演示学会新任务”的突破都可能成为估值叙事的重要筹码,但最终仍需以真实应用效果为准。