在WRC 2026大会上,星动纪元创始人兼CEO陈建宇提出,世界模型可能不仅是VLA的增强模块,而可能成为下一代具身智能的核心范式。他认为,机器人要真正进入物流、服务乃至家庭等开放场景,必须从“模仿人类动作”转向“理解物理世界规律”,而世界模型正是实现这一跨越的关键。
陈建宇将具身大模型的迭代归纳为三个范式:第一范式是语言模型加机器人控制,以ChatGPT出现为起点,但仍是模块化架构,无法端到端训练;第二范式是多模态底座上的VLA模型,约在2023年GPT-4出现后兴起,将视觉、语言和动作融合进统一模型,典型代表包括Google的PaLM系列和RT系列;第三范式则是世界模型,以2024年发布的Sora第一代为标志,具身智能据此发展出“世界动作模型”,不仅能预测动作,还能预测未来世界状态的演化,形成闭环。
陈建宇指出,VLA的局限不在端到端训练本身,而在其学习方式——几乎全靠模仿人类行为数据,遇到新任务时泛化能力有限。而世界模型构建的是对物理世界的常识性理解,例如“水杯倒水水会往下流”这类常识无需反复学习,因此天然具备更好的泛化性。他进一步强调,世界模型的智能底座是视频模型,直接处理原始图像、视频、音频数据,包含更丰富的物理细节,比以语言为底座的多模态模型更适合面向物理世界操作的具身智能。
星动纪元早在2024年就发表了全球首个融合视频预测与动作预测的世界动作模型,比英伟达的类似方案早了约一年。在数据层面,公司构建了基于大规模人类行为的数据集,并加入第一人称人类操作数据;还与Facebook AI团队的Andreas合作完成ControlNet相关工作,提升动作精准可控性,并将世界模型放入真实世界用真实反馈迭代。
陈建宇展示了模型的多项能力:世界模型能精准预测复杂物理现象,生成的图像与真实实拍几乎无法分辨;在零样本任务泛化上,模型能在办公区随机场景中完成“把左边的拖鞋放到右边拖鞋旁边”等带逻辑推理的指令;经过后训练,模型还能完成叠纸盒、翻袜子、脱鞋、开水等精细操作,并具备跨本体能力,能操作灵巧手使用螺钉枪、移液器等工具。
在硬件层面,星动纪元坚持软硬一体全栈自研,从整机、关节模组、机械手到电机、减速器、驱动器均自主开发。公司推出了全球首个面向商用的人形机器人复杂地形方案,2023年底已实现涉水行走、上下楼梯,今年春节期间还发布了全尺寸人形机器人舞剑演示。其灵巧手采用全直驱方案,响应速度极快,一秒钟可点击10次鼠标,负载达24千克。
商业化方面,陈建宇认为今年具身行业已进入拐点。星动纪元从物流工业起步,B端客户项目已覆盖十余个城市,在物流分拣等场景常态化运作,同时开放硬件本体、API和软件工具链供二次开发。他强调,通用机器人是一个持续进化的系统,大脑、本体和场景协同形成飞轮,随着能力提升不断开拓新场景,飞轮将越转越快。