2026年世界人工智能大会(WAIC)上,它石智航成为展区焦点。这家具身智能公司不仅把一条1:1还原的环形线束流水线搬进展馆,还让多台机器人集群协作,在同一产线上同时装配不同线束线型。支撑这套全自动化产线的,是它石智航刚刚发布的具身原生基座模型AWE 3.5

AWE 3.5的命名暗示了其定位——它石希望这款模型能像GPT-3.5一样,在多任务能力上展现新的可能性。与上一代相比,3.5版本开始向更多场景溢出:工业装配、插接、收纳等任务全部被放进同一个模型里,任务之间无需重新加载新模型或切换参数。展台现场,机器人展示了整理桌面、打包手机、插网线、零件分拣等多种操作,观众戴上数据采集夹爪后,还能与一个由AWE 3.5生成的平行世界互动——捏积木、拖拽手机盒、蜡烛火焰等物理反馈均由模型从真实类数据中学到,没有一行牛顿定律代码或碰撞引擎。

在技术架构上,AWE 3.5从预训练阶段就开始将视觉、语言、动作等多种模态一起喂给模型,同一套架构既能输出动作,也能预测未来。这种设计的关键在于:模型本身不变,只改变输入输出的组合方式,就能切换出不同的“人格”。视觉到动作的路径形成Base Policy(基础策略),负责制定指令;以动作为条件预测未来视觉的路径形成Action Condition World Model(动作条件世界模型),负责预测环境变化。两者交互构成一套完整的强化学习闭环。

它石智航CEO丁文超在采访中解释,AWE 3.5最核心的突破是让模型成为自己的“仿真器”,无需手工搭建仿真环境。预训练建立通用物理交互能力,后训练在模型内部的世界里自我对弈、自我强化,形成自闭环。这一范式在语言模型领域已被验证,但在具身原生模型里,AWE 3.5是第一家完整跑通的。

针对具身数据采集的难题,丁文超表示,它石的数据系统重心正从“更多”转向“更聪明、质量更高”,Data Efficiency(数据效率)正在成为新的评测维度。目前预训练已足够扎实,一个新任务只需要小时级别的数据采集就能跑通。除线束装配外,柔性操作、分拣、检测协同等多个工业场景也已在验证中。

丁文超还指出,具身智能的Scaling已经解锁。通过合理的预训练与后训练范式,完成新任务所需的数据量和采集成本已降到最低。他预测,2026年底到2027年可能会出现行业分水岭,届时“能否实现多场景可靠落地”将成为关键评判标准。如果一家企业能用AI化的方法实现多场景规模化落地,就会迅速与其他公司拉开差距。

关于行业路线之争,丁文超认为,真正训模型的人并不在乎所谓的VLA或世界模型之争。他解释,VLA架构中视觉和语言在预训练阶段紧密耦合,动作模态却要到后训练才接入,导致理论与实操之间存在先天裂缝;而世界模型路线虽然利用视频学习表征,但互联网视频模型的Attention结构已在大量通用视频上定型,直接嵌入具身基座模型容易走向极端。AWE 3.5的架构设计则从一开始就避免了这些问题。

在硬件方面,它石智航从AWE 3.0之前就开始自研灵巧手,采用Top-Down思路:先梳理需要完成哪些人类动作、匹配哪些人类数据,再反向定义硬件设计。丁文超认为,灵巧手能否真正胜任实际任务并跑通商业闭环,很可能成为具身智能领域的一个重要里程碑。

对于新入局者,丁文超表示,只凭几篇论文就想创业的难度已经非常高。具身智能正在从局部的技术亮点走向系统化的体系作战,新公司需要寻找差异化的生态位,例如定位为通用世界模型公司,或避开已经高度内卷的桌面级任务,直接选择全尺寸人形等方向。

展望未来12个月,丁文超预计机器人会真正进入更多大众可触达的场景,虽然进入家庭仍存在差距,但机器人将开始承担更多真实的商业任务。到那时,评判标准会变得非常直观:机器人到底完成了哪些事情?扩展新任务的速度有多快?成本有多低?这非常类似自动驾驶早期的发展轨迹——各家公司先圈定几条演示路线,随后开始比拼“开城速度”,最终进入存量竞争和大规模量产阶段。