智元機器人自研的全模態大模型WITA-Omni Preview在行業公認的具身全模態理解權威榜單DailyOmni上,以85.21分的綜合成績登頂榜首,超越了千問、Gemini、豆包、輝達等國內外領先模型,八項細分指標中六項拿下第一。
DailyOmni榜單的評測邏輯聚焦於真實開放環境中的音影片對齊、事件時序判斷和跨模態聯合推理,要求模型同時調動聲音和視覺資訊才能完成問題。WITA-Omni在音影片對齊(86.13分)、事件時序(84.64分)、綜合推理(85.06分)等關鍵指標上均取得領先,尤其在比較理解及30秒/60秒長時序影片理解任務上表現突出。
智元是榜單上少有的具身智慧賽道選手,與通用大模型廠商同台競技並跑贏。這一成績背後是技術路線的差異:WITA-Omni從機器人原生互動場景出發,而非優先適配線上數字內容。此前,智元自研世界模型Genie Envisioner-Sim 2.0已在WorldArena“世界模型感知與動作響應”賽道拿下總分第一,兩項成績分別對應機器人理解物理世界、模擬物理世界以及與物理世界互動的關鍵能力。
WITA-Omni的原生架構在Thinker–Talker範式上擴展出Actor模組,將機器人動作和表情提升為與語音並列的一級輸出。Thinker作為多模態推理核心,將文本、影像、音訊、音影片對映到統一表示空間做跨模態聯合推理;Talker以Thinker的隱狀態為條件流式生成自然語音;Actor由動作頭與表情頭組成,驅動動作與表情。三個模組在統一時間軸上同步推進,替代了傳統“處理完一個再交給下一個”的序列模式。跨流同步機制使Actor能感知語速、停頓、重音和情緒變化,實現邊說邊動、邊動邊表達。
在訓練資料方面,智元使用了千萬小時級多模態資料,其中音影片聯合資料約佔四成,純音訊資料約佔三成,視覺與文本資料分別約佔兩成和一成。智元還自建了以人為中心、面向真實互動場景的大規模高質量全模態資料集,完整保留聲音、畫面、語言、動作和表情之間的時序關係。在千小時級高質量資料上,WITA-Omni採用SFT–OPD–RL三階段後訓練策略:SFT監督微調建立基礎能力,OPD同策略蒸餾將特權資訊下的高質量答案能力蒸餾回學生模型,RL強化學習最佳化互動決策能力。
在語音互動側,WITA-Omni在國際第三方評測Artificial Analysis的Speech Arena所採用的兩個公開基準上均取得第一,超越了GPT-Realtime等閉源商用模型。其中Big Bench Audio衡量語音推理能力,Full Duplex Bench子集衡量全雙工對話能力(覆蓋停頓處理、輪次切換、打斷處理、附和處理)。全雙工對話能力意味著機器人能在真實對話節奏中做出自然反應:該說時說、該停時停、被打斷能自然銜接。
智元圍繞作業智慧、互動智慧、運動智慧“三智一體”打造差異化競爭力。WITA-Omni的登頂補齊了互動智慧這一關鍵維度,使“三智”能力版圖完整。2026年具身智慧行業正從開發態向部署態跨越,機器人走進產線、門店和家庭,三智協同成為核心門檻:運動智慧決定能否走進場景,作業智慧決定能否完成勞動,互動智慧決定能否提供情緒價值和服務生產力。智元已率先推出七大生產力解決方案,WITA-Omni的領先為這些方案提供了底層AI支撐。