智元机器人自研的全模态大模型WITA-Omni Preview在行业公认的具身全模态理解权威榜单DailyOmni上,以85.21分的综合成绩登顶榜首,超越了千问、Gemini、豆包、英伟达等国内外领先模型,八项细分指标中六项拿下第一。

DailyOmni榜单的评测逻辑聚焦于真实开放环境中的音视频对齐、事件时序判断和跨模态联合推理,要求模型同时调动声音和视觉信息才能完成问题。WITA-Omni在音视频对齐(86.13分)、事件时序(84.64分)、综合推理(85.06分)等关键指标上均取得领先,尤其在比较理解及30秒/60秒长时序视频理解任务上表现突出。

智元是榜单上少有的具身智能赛道选手,与通用大模型厂商同台竞技并跑赢。这一成绩背后是技术路线的差异:WITA-Omni从机器人原生交互场景出发,而非优先适配线上数字内容。此前,智元自研世界模型Genie Envisioner-Sim 2.0已在WorldArena“世界模型感知与动作响应”赛道拿下总分第一,两项成绩分别对应机器人理解物理世界、模拟物理世界以及与物理世界交互的关键能力。

WITA-Omni的原生架构在Thinker–Talker范式上扩展出Actor模块,将机器人动作和表情提升为与语音并列的一级输出。Thinker作为多模态推理核心,将文本、图像、音频、音视频映射到统一表示空间做跨模态联合推理;Talker以Thinker的隐状态为条件流式生成自然语音;Actor由动作头与表情头组成,驱动动作与表情。三个模块在统一时间轴上同步推进,替代了传统“处理完一个再交给下一个”的串行模式。跨流同步机制使Actor能感知语速、停顿、重音和情绪变化,实现边说边动、边动边表达。

在训练数据方面,智元使用了千万小时级多模态数据,其中音视频联合数据约占四成,纯音频数据约占三成,视觉与文本数据分别约占两成和一成。智元还自建了以人为中心、面向真实交互场景的大规模高质量全模态数据集,完整保留声音、画面、语言、动作和表情之间的时序关系。在千小时级高质量数据上,WITA-Omni采用SFT–OPD–RL三阶段后训练策略:SFT监督微调建立基础能力,OPD同策略蒸馏将特权信息下的高质量答案能力蒸馏回学生模型,RL强化学习优化交互决策能力。

在语音交互侧,WITA-Omni在国际第三方评测Artificial Analysis的Speech Arena所采用的两个公开基准上均取得第一,超越了GPT-Realtime等闭源商用模型。其中Big Bench Audio衡量语音推理能力,Full Duplex Bench子集衡量全双工对话能力(覆盖停顿处理、轮次切换、打断处理、附和处理)。全双工对话能力意味着机器人能在真实对话节奏中做出自然反应:该说时说、该停时停、被打断能自然衔接。

智元围绕作业智能、交互智能、运动智能“三智一体”打造差异化竞争力。WITA-Omni的登顶补齐了交互智能这一关键维度,使“三智”能力版图完整。2026年具身智能行业正从开发态向部署态跨越,机器人走进产线、门店和家庭,三智协同成为核心门槛:运动智能决定能否走进场景,作业智能决定能否完成劳动,交互智能决定能否提供情绪价值和服务生产力。智元已率先推出七大生产力解决方案,WITA-Omni的领先为这些方案提供了底层AI支撑。