騰訊旗下騰訊 Robotics X、福田實驗室與騰訊混元團隊聯合釋出了具身認知基礎模型 Hy-Embodied-RxBrain-1.0(簡稱 RxBrain),同步公開了技術報告、官方推理程式碼與模型權重。該模型引數量約 62 億,定位為面向具身智慧的統一多模態基礎模型,試圖用一個模型同時解決機器人理解、預測與規劃中的語言推理和視覺想象問題。
RxBrain 的核心設計在於將三項關鍵能力整合進單一的自迴歸序列:具身理解推理,可對影像與多幀影片進行問答和鏈式思維推理;世界狀態預測,能根據動作想象物理世界中即將出現的後續幀;聯合子目標規劃,將任務分解為步驟,併為每一步同時輸出下一步動作的語言描述和應達到的目標影像。這三者通過交錯生成機制實現——模型在自迴歸過程中交替輸出推理文本與流匹配生成的想象幀,由學習到的影像令牌決定何時進行視覺想象,從而將“做什麼”與“世界應呈現什麼狀態”逐步耦合。
在架構上,RxBrain 採用了統一混合 Transformer(Mixture-of-Transformers,MoT)設計,以約 62 億引數的主幹網路承載文本、視覺與生成三種模態的專用通路,使理解與影像合成共享一個自迴歸模型,而非傳統的分離式塔式結構。其影像生成部分依賴流匹配影像頭,將想象幀解碼至凍結的 FLUX VAE 潛空間,支援文本到影像、多幀世界模型推演以及目標影像規劃。
從產業視角看,RxBrain 的釋出標誌著具身智慧模型正從單一任務模組走向“理解—預測—規劃”一體化。傳統機器人系統通常將感知、規劃與控制拆分為獨立模組,而 RxBrain 嘗試在統一模型中完成從視覺理解到行動想象的閉環,這有助於減少模組間資訊損耗,提升端到端任務執行的連貫性。對於 AI 應用層而言,這類模型若能在真實機器人平台上穩定執行,將降低具身智慧系統的開發複雜度,並可能推動世界模型在工業自動化、服務機器人等場景的落地。
值得注意的是,該模型目前僅支援基於 Transformers 的推理(理解與生成),團隊在路線圖中列出了未來將支援 vLLM 推理、微調程式碼以及線上 Gradio 演示。其推理程式碼依賴特定版本的 Transformers 分支,尚未合併至主流發行版,這意味著早期使用者需要一定的工程適配能力。此外,影像生成功能需額外獲取 FLUX VAE 權重,模型許可採用“other”型別,具體商用條款需進一步確認。
在具身智慧賽道,將語言模型與視覺生成深度耦合的探索正成為前沿方向。RxBrain 的交錯推理與想象機制,為智慧體在複雜物理環境中進行多步規劃提供了新的技術路徑,其後續在實際機器人硬體上的表現與生態建設值得持續關注。