8月19日下午,世界机器人大会分论坛“具身智能大模型的进化之路:从技术分级到产业落地”在北人亦创国际会展中心举行。生数科技创始人兼首席科学家、ACM/IEEE/AAAI Fellow朱军发表主旨演讲,发布团队最新研究成果,并系统阐述了通用世界模型的五级发展路线

朱军表示,从大模型发展的视角来看,团队希望构建的不是服务于某个任务或场景的专用模型,而是能够理解世界、预测未来并采取行动的通用基座模型。他强调,通用世界模型不是单一的生成器、模拟器、机器人动作模型或策略模型,也不是这些能力的割裂片段或简单线性串联,而是三种能力耦合在一起的闭环反馈系统——行动不仅是模型的输出,还会改变环境、产生新信息,并进入下一轮理解、预测和决策。

在数据方面,通用世界模型需要一个由观察逐步走向行动的多层数据金字塔:从海量网络视频开始,逐步扩展到特定领域视频、第一视角人类视频、带动作记录的人类示范,以及真实机器人交互数据。越靠近底层,数据规模越大、覆盖面越广;越靠近顶层,数据更稀缺、成本更高,却能更直接地建立任务、动作与物理结果之间的联系。合成数据可以贯穿每一层,同时“不完美数据”也具有重要价值——失败尝试、纠正动作和恢复过程都包含有效的学习信号。

在架构层面,通用世界模型需要统一处理图像、视频、语言和机器人动作等不同模态信息。生数科技提出的MoT(Mixture-of-Transformers)架构通过为不同模态配置专属参数,并以共享注意力实现跨模态信息交互,使环境理解、世界状态预测与动作生成能在同一模型中协同完成。基于该架构的世界动作模型Motubrain,将理解、预测与行动统一建模,打破传统分模块方案的能力割裂,同时提升异构数据利用效率和跨任务迁移能力。算力则同时影响大规模预训练和实时部署——离线视频生成可容忍一定等待时间,但实时交互和机器人控制必须在环境变化前完成预测和决策,因此训练基础设施、推理加速、模型蒸馏和高效注意力机制都是重要支撑。

朱军将通用世界模型划分为五个逐级演进的层级,并指出生数科技过去几年的研发与落地实践已覆盖前三个层级。L1世界生成,让模型学会生成连贯的世界演化过程,视频是这一阶段最典型的载体。2024年生数科技推出视频生成大模型Vidu,完成了L1阶段的初步实践。L2与世界交互,模型开始接收实时输入,并根据语言、语音或控制信号持续改变后续内容。2026年7月发布的Vidu S1将这一能力推进到实时交互阶段,用户可通过语音实时介入生成过程。L3在世界中行动,模型从数字世界进入物理世界,环境理解、未来预测和动作生成真正统一。Motus于2025年12月发布并全面开源;2026年4月发布的Motubrain则进一步将环境理解、世界状态预测和动作轨迹生成统一到同一模型中,推理速度较Motus提升约10倍,适配新机器人本体时仅需50至100条人类示范数据,在RoboTwin 2.0基准测试中得分96.1分,位居榜首。目前Motubrain已在包括银河通用、星尘智能、千寻智能等近十种本体上完成验证,展现出长程任务、多任务场景和不同机器人形态之间的泛化能力。

L4自主世界智能体要求模型具备真实行动能力后,进一步走向自主决策,能围绕长期目标主动感知环境、拆解任务、探索未知状态并持续规划行动。L5世界组织者则不再只控制单个智能体,而是统筹机器人、数字智能体、人类、工具及其他资源,完成更复杂的任务分配与多智能体协作。朱军指出,从L1到L5能力层层递进,没有对世界演化规律的学习和预测,就难以形成稳定连续的交互;没有真实行动带来的环境反馈,也很难进一步发展出自主学习、长期规划和复杂协同能力。

目前L1至L3已形成较为具体的技术实践,但距离更高阶的世界智能仍有差距。视频模型仍需持续提升生成质量、可控性与时空一致性;世界动作模型则需在更复杂、更开放的真实环境中提升稳定性、泛化能力与执行效率。继续迈向L4和L5,还需突破六项关键挑战。生数科技表示,将持续强化世界生成、与世界交互、在世界中行动三个层级,并补齐目标形成、主动探索、持续学习和长期记忆等能力,为更高阶的自主世界智能体奠定基础。更长远的目标是构建一个能够持续理解世界、预测不同行动后果、在明确约束下自主行动,并从真实反馈中不断学习和进化的通用基座。当理解、预测与行动真正形成闭环,世界模型将不再只是生成内容的模型或执行任务的机器人策略,而会成为连接数字世界与物理世界、迈向通用具身智能的重要基础。