紫東太初最新開源的通用多模態大模型 ZDTaichu5.0-9B,把10B以下通用模型的空間具身能力上限又往上推了一截。按官方給出的評測,在九項空間測試的10B檔位通用模型中,該模型拿下八項第一,幾乎呈斷層領先態勢。
過去的多模態模型大多能把一張圖片理解得頭頭是道,但一旦進入真實物理世界,空間理解與行動規劃往往跟不上;而一些模型為了補足空間能力,又不得不犧牲通用能力。ZDTaichu5.0-9B試圖同時兼顧這兩條線:一方面能完成複雜的空間理解與高層任務規劃,另一方面在圖文理解、文字識別、數學推理和程式碼能力上仍保持第一梯隊。
從具體評測數字看,在差距較大的 MindCube-tiny 對比中,ZDTaichu5.0-9B得分為 78.27分,Gemma4 8B-E4B、Gemini 3 Pro和Grok 4分別為 48.85、70.87和63.56。整個榜單覆蓋空間感知、三維推理、多視角變換與具身互動。通用能力方面,圖解理解基準 AI2D 達到 91.48分,僅次於Gemini 3 Pro,高於其他對照模型;WeMath 為 75.9分,同樣領先;MathVista Mini 為 84.5分、OCRBench 為 85.5分。在Agent與文本任務上,程式碼成績尤為突出。
官方演示了三個空間任務:在台面擠滿杯子與雜物的場景中,模型需同時理解“銀色”“盒子”“從左到右第二個”三層關係,其給出的歸一化座標 (237,226) 落在目標標註區域內;在多視角房間場景中,模型需設想自身移動到綠框窗簾位置、面向藍框沙發,再判斷紅框櫃子的相對方位。這些例子分別對應目標選擇、參照系轉換和互動條件判斷,是機器人執行真實物理任務的關鍵環節。
支撐這些能力的是資料工程與推理機制兩條線。資料側,紫東太初組織了一套經過全流程驗證、可複用、可遷移的管線:原始素材先經感知雜湊與URL去重,再過濾低清晰度、圖文不相關樣本,隨後進行內容重寫解析和影片抽幀描述,最終打包成可訓練的圖文與時序輸入。開源SFT指令、真實業務問答、空間具身案例以及Agent工具呼叫軌跡,被組織成多輪對話、多圖和影片序列。針對具身樣本,管線還會檢查影像、問題、物件關係和操作約束是否一致;帶步驟的思維鏈也要經過拒絕取樣、格式與一致性校驗。團隊還建立了能力域—難度—質量標籤三維自動標籤系統,用於篩選高資訊量樣本,並強調評測資料不會直接作為訓練樣本。
訓練側採用 GRPO,把答案是否正確、空間座標是否命中、輸出格式是否合規轉化為可自動校驗的獎勵訊號。推理側則引入內建自適應迴圈推理:模型先完成一次標準前向計算,得到Token預測分佈與隱層狀態,再由熵門控評估不確定性;確定性較高時直接輸出,遇到高不確定性節點則在內部重複執行部分層塊計算,迭代調整隱層表徵,為當前判斷增加計算深度。配套的三重穩定化工程設計包括阻尼更新、雙重停止判據(同時監測輸出分佈的KL散度與隱狀態殘差)以及軌跡讀出與狀態回滾。
值得注意的是,這種按任務需要調節推理投入的思路,在OpenAI的 GPT-6 Astra 上也有所體現——官方文件顯示Astra支援調節推理投入,並允許在對話中為困難任務提高投入、為常規任務降低投入。ZDTaichu5.0-9B在開源模型中較早落地了這一機制。
在實體任務中,模型還要處理外部任務迴圈:接收新觀測與執行反饋,更新任務進展。演示中,模型在工具輔助下識別目標區域,組織接近、抓取、抬起、移動、放下和退出等動作,新的觀察結果繼續影響後續操作,最終確認乳酪盒留在碗內。內外兩套迴圈讓每次行動成為下一輪判斷的新條件,以提升長程任務成功率。
紫東太初此次不只開放權重,還一併公開了整套經過工業級驗證的資料生產管線方案,企業可用自己的資料和機器人繼續訓練,迭代出更個性化的空間多模態模型。官方展示的落地方向包括自動化科學實驗平台中的試管抓取、雙臂交接與入架,以及製造場景中的機台上料與工件轉移。對開發者而言,這是一份早期驗證答卷;對紫東太初而言,則意味著其通用多模態能力進一步向空間理解與具身任務規劃延伸,後續產業價值仍將在更多具體任務中接受檢驗。