2026年9月9日,来自北京海淀中关村的深度机智正式发布物理基座模型PhysBrain 1.5,在28项公开基准上取得72.5的综合均分,位居参评开源模型首位。这一成绩与头部闭源模型GPT-6 Astra(73.3)、Gemini 3.6 Flash(73.0)的差距已收窄到1分以内。
评测覆盖五大能力维度:视觉空间感知、空间与多视角理解、具身认知与规划、空间指向与可供性、视觉轨迹推理。PhysBrain 1.5-8B在28项中拿下14项开源第一、10项开源第二,相较最强开源对手Hy-Embodied-VLM-1.0(66.0)高出约6.5分,较RynnBrain 1.1(63.1)高出9.4分。细分项目中,RoboSpatial-Home空间理解取得73.9分,Part-Affordance可操作部位识别84.0分,RoboRefit视觉目标定位89.8分。
这一结果的背景,是通用大模型在具身操作上暴露出的边界。Google DeepMind于2026年7月30日发布Gemini Robotics 2,基于Gemini 3.5 Flash构建具身推理大脑ER 2;OpenAI的GPT-6则在推理、编程与多模态理解上再度突破。Robocurve的一项实验把GPT-6 Astra部署在真实机械臂上,在20次「积木放入碗」任务中完成19次,而Claude Fable 5.1仅完成8次;但在「蓝色拼图块对位插入凹槽」这类毫米级精细任务上,GPT-6 Astra的成功率从95%掉到10%。这说明通用理解能力可以跨越「看懂」到「粗动作」的鸿沟,却在精细接触与精准插入面前止步。
深度机智选择的路线并非比拼参数规模,而是把物理智能基础模型能力作为核心战略方向。其提出的Physical Loop(物理智能循环)统一架构,把「观察世界—理解空间与任务—判断动作后果—执行—反馈修正」五步原本分散在不同模型中的能力,重新组织进同一个基座模型。过去物理AI系统普遍采用「理解模型+动作模型+预测模型」的拼接方案,每个子模型都需单独训练与调优;PhysBrain 1.5则基于开源基础模型,将语言回答、空间坐标、动作轨迹、未来画面与深度预测纳入同一套训练框架,使具身理解、动作生成与未来状态预测彼此约束、协同演进。
数据来源是这条路线的基础。团队在论文中明确,物理感知的预训练监督完全来自人类交互视频:通过全景视频记录任务执行时的周围环境,并同步保留全身姿态、手部运动与任务级语音,使一段交互不只是孤立的动作片段,而带有连续的任务、动作与状态变化上下文。连接人类数据与动作模型的是Human-as-Humanoid框架,它把人类行为数据从「可观看的记录」转化为「可训练的资源」。在此前研究中,这条转换链路已延伸到自研的60自由度拟人体机器人Prime U,原始示范吞吐量达到传统遥操作的4.8至7.2倍,并在部分任务上实现从人类数据到真机执行的零样本迁移。
模型能力之外,PhysBrain 1.5同步开放了2B与8B两档参数规模。2B版本按官方评测规则仅作参考、不参与开源排名,但其66.6的综合得分已超过表中所有其他非PhysBrain开源参评模型,包括30A3B规模的Hy-Embodied-VLM-1.0(66.0)、8B的Embodied-R1.5(64.9)和9B的RynnBrain 1.1(63.1)。两个版本均已上线Hugging Face,技术报告、模型权重与评测工具包全部向社区开放。上线仅3天,PhysBrain 1.5获得超过3k的下载量。
从产业视角看,这条新闻值得关注的并非单一分数,而是路线选择本身。多数参与者默认物理智能是「大模型顺手能做好的延伸」,先把语言能力推到极致,再给模型接上动作输出。GPT-6 Astra的机械臂实验既展示了通用基础模型提升可转化为物理行动能力,也暴露了其在精细操作上的局限,侧面说明物理智能需要专门的基础模型。深度机智自2025年10月发布《源于人,超越人》技术路线图起,即把「人类学习」作为物理通用智能的核心研发路径,围绕以人类数据为起点、以动作为中心建模、身体为AI设计三大战略展开数据、模型、本体全栈布局。
政策与行业层面亦有呼应。2026年7月,深度机智创始人陈凯博士在WAIC 2026具身智能空间交互论坛上,以《人类学习范式:物理通用智能远征的起点》为题阐述相关技术判断;9月10日,国家数据局党组书记、局长刘烈宏主持召开具身智能座谈会,深度机智受邀出席并展示人类全景真实数据与情境数采(In Context Data Collection)范式。从2025年12月提出情境数采范式,到2026年7月迭代出全景数采范式,该公司在半年多时间内推进了数据采集能力与模型驱动的全自动标注管线。
整体来看,PhysBrain 1.5的登顶标志着具身基座模型的竞争正从单项能力较量转向系统能力对决,而开源权重与评测工具包的开放,也为全球开发者提供了在统一基座上验证与二次开发的入口。这条路线能否在真实机器人任务中持续兑现,仍有待更大规模的真机数据检验。