8月27日,小鹏汽车发布第二代VLA(视觉语言动作模型)的首次重大升级,新系统XOS 6.3.0将由旗舰车型G9L首发。此次升级的核心是引入“时间”维度,让模型不仅处理当前画面,还能结合过去一段时间的道路变化进行决策,并预测交通参与者的下一步动作。这一技术方向旨在应对复杂场景下的判断、响应和稳定性挑战,而这些正是当前领航辅助驾驶普及后,车企拉开差距的关键领域。
据工信部数据,2026年以来,国内搭载组合驾驶辅助功能的乘用车新车渗透率已达70%,其中NOA(领航辅助驾驶)车型超过30%。随着基础功能逐渐普及,复杂场景下的表现成为竞争焦点。小鹏此次升级的技术细节包括:新增Infini-VLA长时序架构,可调用此前30秒的道路信息;X-Foresight预测模型用于推演未来6秒内的场景变化;流式推理则让感知、计算和车辆动作更紧密地衔接。小鹏称,新版本端侧模型参数量扩大3.5倍,响应速度提升300%,多维综合安全能力提升20倍。
这里所说的“理解时间”,并非AI获得了抽象的时间概念,而是模型能够连续处理环境变化。例如,面对行人折返、前车急刹或旁车加塞时,仅识别当前一帧往往不够,还需结合此前运动轨迹判断下一步风险。对量产辅助驾驶而言,这是一项有明确应用价值的工程升级。
技术能否形成竞争力,关键仍在上车。G9L已于8月11日开启预售,预售价25.98万元,提供纯电和增程版本。小鹏还计划在该车上打通智驾模型与座舱模型,实现语音靠边停车、就近泊入等功能,并将部分Robotaxi开发成果应用到量产车。此外,搭载第二代VLA的Robotaxi近期获得广州市智能网联汽车远程测试资质,可在广州相关一、二、三级测试道路开展主驾无安全员道路测试,标志着小鹏进入主驾无人的关键道路验证阶段。
小鹏在尝试把大模型从单一的驾驶算法,扩展为整车智能底座。驾驶、泊车、座舱和车身控制若能共享模型能力,可以减少不同系统之间的信息割裂,也有利于后续通过OTA持续升级。不过,跨系统协同也对软硬件适配和安全验证提出了更高要求。
此次升级并非从零开始。第二代VLA已于今年3月开始向部分车型推送,小鹏开发的X-World世界模型也已用于闭环仿真、在线强化学习和模型评估。相比一次发布会上的演示,数据采集、仿真验证和持续迭代能力,才是决定模型上限的基础。
行业竞争也在同步加速。理想汽车已通过OTA推送VLA驾驶功能;华为今年4月发布ADS 5,引入云端多智能体训练、在线强化学习和车端风险场。不同企业的技术名称和评价口径并不相同,但方向较为一致:从规则驱动和局部模型,转向数据、算力与大模型共同驱动的系统。
持续研发投入为小鹏参与这场竞争提供了基础。2026年第二季度,公司研发费用为29.1亿元,同比增长32.1%;同期实现收入197.4亿元,同比增长8%,综合毛利率达到20.7%。截至7月底,小鹏累计交付量已超过120万辆。不断扩大的车辆规模,有助于积累更多真实道路数据,并支撑模型训练、问题发现和后续迭代。如果同一技术底座能够在量产车、Robotaxi等产品间复用,其研发投入也有望获得更大的规模效应。
从目前进展看,小鹏第二代VLA正在从单点功能升级转向模型、芯片、数据和整车协同,G9L将成为新版本接受市场检验的重要车型。不过,“L4能力下放”更多是对技术来源和体验的描述,量产功能现阶段仍属于组合驾驶辅助,驾驶员需要持续关注道路。
值得一提的是,2025年12月,小鹏董事长何小鹏曾表示,如果小鹏VLA在2026年8月30日前,在国内达到特斯拉FSD V14.2在硅谷的整体表现,他将在硅谷参考小鹏总部餐厅筹建一家中国风味食堂;如果未能实现,小鹏自动驾驶负责人刘先明则要接受“惩罚”。相比赌约最终如何兑现,G9L搭载新版本后的实际接管表现和用户反馈,更具有观察价值。