北京智源人工智慧研究院(BAAI)正式釋出了名為Orca的世界基礎模型,其核心理念與當前主流AI路徑形成鮮明對比。Orca不預測下一個文本令牌、下一幀影片畫面或下一步機器人動作,而是學習在抽象內部表徵中預測世界的下一狀態。研究團隊認為,真正的智慧不應由語言模型、影片生成器或機器人控制器這類專用預測模型來定義,而應構建對世界變化規律的通用理解,並以此為基礎支撐多樣化任務。

Orca的訓練策略融合了兩種互補的學習模式。在“無意識學習”階段,模型接觸的是沒有任何文字標註的原始影片——它觀察當前畫面,並在抽象空間而非畫素層面預測下一畫面,從而自主捕捉運動模式、遮擋關係與典型場景動態。隨後進入“有意識學習”階段,影片被切分為片段,每個片段配有描述狀態變化的文字說明,使模型理解特定動作如何引發狀態轉移。此外,模型還通過經典影片問答任務進行訓練,以保持對自然語言查詢的響應能力。

在架構設計上,Orca以預訓練語言-影像模型Qwen3.5為基礎,訓練完成後核心部分保持凍結。針對不同輸出型別,研究人員附加了獨立的小型模組:文本輸出沿用Qwen3.5原有的語言頭,影像生成通過小型介面卡層連線至Stable Diffusion 3.5,機器人動作則由從零開始訓練的“動作專家”控制模組負責。這種設計刻意不追求單一基準上的最高分,而是驗證一個訓練良好的內部世界狀態能否成為多種任務的共享基礎。

訓練資料方面,團隊彙集了16萬小時影片素材、1.6億條事件描述以及1150萬個問答對。影片涵蓋四種視角:日常互動的第一人稱視角、物體操作的第三人稱視角、無動作資料的機器人錄製以及自然場景。值得注意的是,當前版本僅使用了影片資料總量的十分之一

在基準測試中,Orca的40億引數版本在MVBench、TemporalBench、3DSRBench和SWITCH四項文本基準上取得51.8% 的平均分,在引數量相近的小型視覺語言模型中位居前列,並超越了引數量更大的世界模型Emu3(80億引數)和Emu3.5(340億引數)。在影像預測方面,研究團隊自建了名為PRICE-V0.1的基準,要求模型根據“關上微波爐”等指令生成結果影像。Orca-4B以59.8% 的平均得分超越了FLUX.2 small(56.1%)、FLUX.1-context(40.9%)和OmniGen2(39.6%)等專用影像生成模型。與純影像模型相比,Orca在保持機器人形態、物體接觸點以及與指令的關聯性方面表現更為連貫,較少出現無關物體或幻覺手部等問題。

最引人關注的是機器人控制實驗。在包括整理書籍、疊放碗具、舀取砂糖在內的五項雙臂輪式人形機器人操作任務中,Orca的效能與專門基於機器人資料構建的系統π0.5旗鼓相當。關鍵在於,Orca的基礎模型在預訓練期間從未接觸過任何動作標籤——它不知道哪類影像對應哪種運動。實際的機器人控制能力來自後期單獨訓練的模組,該模組僅使用每項任務200次真實世界錄製資料,將攝像頭影像與執行動作進行配對。在演示中,Orca在經歷數次抓取失敗後能夠重試並最終完成任務,展現出一定的容錯與調整能力。

這一成果對機器人產業具有深遠意義。當前具身智慧發展的一大瓶頸在於高質量動作標註資料的極度稀缺,採集成本高昂且難以規模化。Orca的路徑表明,通過海量無標註影片預訓練獲得對物理世界的通用理解,再以極少量特定任務資料微調,或許是一條可行的技術路線。它並非要取代專用系統,而是提供了一種可複用的通用基座,有望大幅降低機器人學習新技能的資料門檻,加速具身智慧從實驗室走向真實場景的程序。