紫东太初最新开源的通用多模态大模型 ZDTaichu5.0-9B,把10B以下通用模型的空间具身能力上限又往上推了一截。按官方给出的评测,在九项空间测试的10B档位通用模型中,该模型拿下八项第一,几乎呈断层领先态势。

过去的多模态模型大多能把一张图片理解得头头是道,但一旦进入真实物理世界,空间理解与行动规划往往跟不上;而一些模型为了补足空间能力,又不得不牺牲通用能力。ZDTaichu5.0-9B试图同时兼顾这两条线:一方面能完成复杂的空间理解与高层任务规划,另一方面在图文理解、文字识别、数学推理和代码能力上仍保持第一梯队。

从具体评测数字看,在差距较大的 MindCube-tiny 对比中,ZDTaichu5.0-9B得分为 78.27分,Gemma4 8B-E4B、Gemini 3 Pro和Grok 4分别为 48.85、70.87和63.56。整个榜单覆盖空间感知、三维推理、多视角变换与具身交互。通用能力方面,图解理解基准 AI2D 达到 91.48分,仅次于Gemini 3 Pro,高于其他对照模型;WeMath75.9分,同样领先;MathVista Mini84.5分OCRBench85.5分。在Agent与文本任务上,代码成绩尤为突出。

官方演示了三个空间任务:在台面挤满杯子与杂物的场景中,模型需同时理解“银色”“盒子”“从左到右第二个”三层关系,其给出的归一化坐标 (237,226) 落在目标标注区域内;在多视角房间场景中,模型需设想自身移动到绿框窗帘位置、面向蓝框沙发,再判断红框柜子的相对方位。这些例子分别对应目标选择、参照系转换和交互条件判断,是机器人执行真实物理任务的关键环节。

支撑这些能力的是数据工程与推理机制两条线。数据侧,紫东太初组织了一套经过全流程验证、可复用、可迁移的管线:原始素材先经感知哈希与URL去重,再过滤低清晰度、图文不相关样本,随后进行内容重写解析和视频抽帧描述,最终打包成可训练的图文与时序输入。开源SFT指令、真实业务问答、空间具身案例以及Agent工具调用轨迹,被组织成多轮对话、多图和视频序列。针对具身样本,管线还会检查图像、问题、对象关系和操作约束是否一致;带步骤的思维链也要经过拒绝采样、格式与一致性校验。团队还建立了能力域—难度—质量标签三维自动标签系统,用于筛选高信息量样本,并强调评测数据不会直接作为训练样本。

训练侧采用 GRPO,把答案是否正确、空间坐标是否命中、输出格式是否合规转化为可自动校验的奖励信号。推理侧则引入内置自适应循环推理:模型先完成一次标准前向计算,得到Token预测分布与隐层状态,再由熵门控评估不确定性;确定性较高时直接输出,遇到高不确定性节点则在内部重复执行部分层块计算,迭代调整隐层表征,为当前判断增加计算深度。配套的三重稳定化工程设计包括阻尼更新、双重停止判据(同时监测输出分布的KL散度与隐状态残差)以及轨迹读出与状态回滚。

值得注意的是,这种按任务需要调节推理投入的思路,在OpenAIGPT-6 Astra 上也有所体现——官方文档显示Astra支持调节推理投入,并允许在对话中为困难任务提高投入、为常规任务降低投入。ZDTaichu5.0-9B在开源模型中较早落地了这一机制。

在实体任务中,模型还要处理外部任务循环:接收新观测与执行反馈,更新任务进展。演示中,模型在工具辅助下识别目标区域,组织接近、抓取、抬起、移动、放下和退出等动作,新的观察结果继续影响后续操作,最终确认奶酪盒留在碗内。内外两套循环让每次行动成为下一轮判断的新条件,以提升长程任务成功率。

紫东太初此次不只开放权重,还一并公开了整套经过工业级验证的数据生产管线方案,企业可用自己的数据和机器人继续训练,迭代出更个性化的空间多模态模型。官方展示的落地方向包括自动化科学实验平台中的试管抓取、双臂交接与入架,以及制造场景中的机台上料与工件转移。对开发者而言,这是一份早期验证答卷;对紫东太初而言,则意味着其通用多模态能力进一步向空间理解与具身任务规划延伸,后续产业价值仍将在更多具体任务中接受检验。