九识CTO庄立9月17日首次披露,公司已建成业内首个L4级万卡集群,算力集群总规模近1.5万卡,九识由此成为首个建成万卡集群的L4无人驾驶团队。一周前的9月10日,九识CEO孔旗在广州宣布公司战略升级为“城市级物理AI”。

万卡集群指的是由超过一万张加速卡组成的高性能计算系统,用于训练基础大模型。单张AI加速卡是计算单元,万卡集群则相当于一座由上万台设备组成的“AI超级工厂”,能把复杂的大模型训练任务拆解后并行处理。九识方面认为,算力层级将在基础设施层面决定一家智驾企业的智能上限。

支撑这次升级的核心,是九识的APEX多模态基座大模型。据披露,该模型正在从百亿级参数规模向千亿级迈进,融合了海量真实L4驾驶数据、互联网语言与视频知识语料,以及真实运营中的人类决策数据。训练完成后,APEX向下赋能数据、模型、评测,形成迭代闭环。

九识成立于2021年8月,创始团队曾在百度硅谷研究院主导Robotaxi、Robotruck研发,并参与第一代Apollo开源平台建设,创业之初即选择RoboVan方向。从2023年卖出第一台车至今,九识全球车队超过3万台,覆盖20多个国家、300多座城市,累计真实运营里程超过2.7亿公里,三年运力增长100倍。

这些运营数据正是九识强调的差异化资源。城市货运场景中大量长尾非标路况——无标识乡村道路、临时施工围挡、异形障碍物、人车无序混行、恶劣天气光影突变——难以用人工规则穷尽,也难以在实验室或仿真中完全复现。九识的逻辑是:算力越强,模型迭代越快;模型越强,运营成本越低,更多客户愿意使用,车辆跑起来又产生更多稀缺数据。孔旗曾表示,复杂城市开放道路能产生高价值数据,而商业模式本身需要赚钱,才能持续获取数据、推动技术进步。

在技术架构上,九识构建了一套车云协同机制,核心逻辑是场景越复杂、云端大模型介入越深。当前主流车端端到端模型可较好覆盖30km/h以上的一般道路场景,但存在能力边界。九识针对不同路况与速度区间分层部署模型:在5-30km/h复杂道路场景,车端VLA进行本地实时推理的同时调用云端VLA模型增强理解;在0-5km/h末端场景,除车端与云端VLA外,还引入安全员Agent,可自主完成极端场景下的救援脱困,作出绕行、重新规划路线、靠边停车等决策。九识方面称,其与L2方案的本质区别不在于车速,而在于车端在判断自身能力不足时会主动降速或停车、呼叫云端分析并给出指令,而非被动等待接管。

九识还提到一个技术细节:其VLA并不强制翻译成人类语言再去操控车辆,而更像人类行动前的“念头”——看到前方有车决定刹车让行,这个“念头”比说出“我要刹车”更快、更抽象、更压缩。九识用对齐人类语言的方式,让模型在决策前先思考因果。

从产业视角看,九识此次披露的核心信息是:一家L4无人驾驶公司正在把自身定位从“卖车、服务、运力”的运营商,向拥有稀缺物理世界数据的大模型公司延伸。通用大模型公司缺少物理世界数据,而多数自动驾驶公司缺少足够规模的真实运营数据,九识试图同时占据两端。万卡算力是硬件底座,APEX基座模型是软件大脑,2.7亿公里真实运营里程是场景来源,三者构成数据、算力、模型、工程四重自增强壁垒。这一路径能否在成本与效率上跑通,仍有待其商业化规模与模型迭代速度的持续验证。