具身智慧領域權威評測WorldArena 2.0 Track 1近日公佈最新成績,崑崙行機器人研發的崑崙世界模型GeWu以69.58分斬獲影像質量(Image Quality)單項冠軍,並以65.91的綜合得分獲得全球榜單亞軍。該模型在物理一致性(Physics Adherence)、可控性(Controllability)等多項關鍵能力維度上實現大幅領先,是本次77支參賽模型中唯一一個在6大評測維度中,獲得其中4項前4名次的模型,展現出較強的綜合能力。
WorldArena由國際頂尖高校及科研機構聯合共建,是世界模型賽道的權威評測基準。WorldArena 2.0在1.0的基礎上構建了更全面的基準,從模態、功能、平台三大關鍵維度擴充套件具身世界模型評估。本次評測的Track 1賽道聚焦具身智慧模型的基礎核心能力,重點考核模型“看得準、猜得對、畫面真實合理”的核心素養,突出模型在物理因果上的合理性。該賽道吸引了全球幾乎所有頂尖世界模型研發團隊同台競技,被譽為具身世界模型的“國際競技場和權威試金石”。
崑崙世界模型是崑崙行機器人研發的第一代世界模型,初次亮相即取得全面領先。據崑崙行介紹,其架構設計遵循“物理因果”第一性原理,不按模態拆分,而是按因果圖中的角色語義,將模型拆為三座引數獨立的Transformer塔:Tower 1負責Intent(目的),以自迴歸方式編碼語言指令和場景理解;Tower 2負責Intervention(干預),以flow matching範式建模動作序列;Tower 3負責Consequence(響應),同樣基於flow matching生成未來影片幀。三座塔共享decoder基礎結構,但每層擁有獨立的投影矩陣、前饋網路和歸一化引數。
這一架構的關鍵在於塔間的資訊流控制。崑崙世界模型通過聯合因果注意力機制(United Causal Attention),在三塔之間施加嚴格的單向可見性約束:Tower 2可以看到Tower 1但不能看到Tower 3;Tower 3可以同時看到Tower 1和Tower 2。這意味著“行動決策”可以參考“任務目的”,但不能偷看“尚未發生的視覺後果”;而“影片渲染”需要同時知道“要做什麼”和“怎麼做”,才能生成物理因果上合理的畫面。
消融實驗印證了這一設計的必要性:一旦切斷其中任意一條注意力通路,模型便會迅速從“因果模擬”退化為“默寫模式”——它不再依據具體動作推演物理後果,而是直接將任務描述對映到訓練集中最相似的影片片段,產生違揹物理規律的畫面。這一退化在評估模型物理合理性的核心維度互動質量(Interaction Quality)上表現得尤為明顯。崑崙世界模型在該維度上取得了82.40的高分,正是因果架構發揮作用的直接體現。
三塔架構還天然支援多工的統一推理。借鑑UniDiffuser的思想,通過調整各塔的噪聲引數,同一套架構和權重即可在世界模擬、策略推理、聯合預測等多種模式之間靈活切換。當動作塔和影片塔同時處於生成狀態時,崑崙世界模型採用非同步排程策略,讓動作塔的去噪進度始終領先於影片塔,確保影片生成看到的動作資訊始終更乾淨、更可靠。
面對長時序影片生成的需求,崑崙行研發團隊設計了Chunk-wise自迴歸方案:長影片被拆分為多個片段逐段生成,核心挑戰在於後續片段的上下文缺失。為此,崑崙世界模型引入了仿生記憶取樣策略——模仿人類記憶的衰減規律,近端幀高密度保留以維持運動連續性,遠端幀稀疏取樣以保留任務全域性進度。配合絕對時序位置編碼和幀率自適應放縮機制,模型在所有生成階段都能準確感知物理時間位置,並靈活控制動作節奏。
崑崙行機器人的模型研發負責人郝志會博士表示,在研發過程中,團隊反覆驗證了一個核心判斷:世界模型的架構設計應當尊重物理世界的因果結構。“目的驅動行動,行動產生結果”這條因果鏈不僅是人類理解物理世界的基本框架,也應當成為模型架構的第一性原理。當歸納偏置對齊問題本質時,團隊不僅看到了指標的提升,也看到了訓練效率和泛化能力的同步改善。
崑崙世界模型是崑崙行沿這一技術方向邁出的第一步。接下來,研發團隊將在更復雜的任務場景中持續驗證和擴充套件模型能力,並將崑崙世界模型應用於行為規劃和模擬強化,推動世界模型從視覺渲染器進化為真正的物理智慧基座。
崑崙行(Kunlunx AI)致力於打造面向物理世界的通用AI機器人,堅持“本體+大腦”雙輪驅動戰略,構建通用AI機器人本體、資料、小腦、大腦、智慧體五位一體的全棧核心技術自研體系。公司認為物理因果是具身智慧的第一性原理,並以此為核心打造崑崙世界模型(KWM),推動物理AI從實驗室走向真實場景的規模化應用。