9月15日,智象(HiDream.ai)发布原生全模态音视频生成模型HiDream-O1-Video-1.0(简称HiDream V1)。其图生视频能力在Artificial Analysis排名第4,在Arena.ai的图生视频模型榜单中排名第8,双榜进入全球前十,跻身全球视频生成模型第一梯队。
这一发布的时间点值得关注。近几个月,AI视频生成赛道持续升温:7月31日,Seedance2.5与MiniMax H3同日发布;8月,阿里发布Wan3.0;进入9月,智象HiDream V1加入战局。短短两个月,多家厂商接连推出新一代视频生成模型,以字节Seedance、MiniMax H3、阿里Wan 3.0和智象HiDream V1为代表的中国模型,开始在全球主流榜单头部形成集群,中国视频生成模型正从单点领先转向多家并进。智象作为创业公司进入这一竞争区间,也意味着全球视频模型头部牌桌上,除了大厂和上市企业,开始出现新的玩家。
从产品能力看,HiDream V1的一个差异化设计在于对用户意图的理解与时长规划。常规视频生成工具要求用户把提示词写得详尽,镜头、光线、动作、时长逐项交代,但真实场景中用户输入往往只是一句口语或一个模糊念头。HiDream V1的做法是,在生成前先通过多模态意图理解模块分析需求,再调用多模态理解模型进行结构化规划,规划字段覆盖人物、动作、镜头、光影、台词、声音等关键信息,将自然语言需求拆解成可执行的分镜信息后进入联合生成。
时长也被纳入规划。多数模型的生成时长由提示词预先设定,输入5秒就在5秒窗口内完成内容,动作未结束也只能压缩处理。HiDream V1则让模型根据内容自行规划时长,结合事件展开、动作完成和叙事节奏决定生成长度,原生支持5至20秒任意时长生成。在此基础上,1080p高保真输出保障单镜头画质,为连续叙事提供基础。
在实测中,智东西用三个场景检验了这套机制。意图理解测试中,模型根据一张从故事中途切入的参考图,还原了人与狗的动向,并在细节上透露出疲惫姿态。时长规划测试中,面对一个撑不住十秒情节的短提示词,HiDream V1并未强行凑时长,视频时长仅为7秒,鸟叫、猫咪抬头动作与懒洋洋的姿态保持良好。音画一致性测试中,模型在说唱舞台场景里实现了嘴型与歌词的对应,并将提示词中故意漏掉的一个字补全。
更值得关注的是模型对真实世界运动规律的处理。视频模型要跨过的分水岭,是让画面里的运动符合真实世界的因果。HiDream V1在生成与叙事规划中强化了对物理规律的建模,包括物体在重力下如何落下、碰撞如何反馈、惯性如何延续、光影如何衰减、空间如何保持连续等。
三组测试分别覆盖精细操作、多人运动和复杂运动。拧螺丝场景中,模型理解了连续动作关系,螺丝刀与螺丝位置保持对应,双手与工具的空间关系整体自然。NBA三分绝杀场景中,球员的肌肉线条、篮球的飞行轨迹和旋转符合现实物理规律,仅在最后出现一点人物位置偏移。奥运会百米飞人大战场景中,模型基本还原了从发令、起跑到并肩冲刺的完整过程,运动员跑步姿态、摆臂和腿部动作保持连贯,人物之间没有明显肢体穿模,脚步声与步频也能对应。
支撑这些能力的,是智象先规划、后联合生成、再以多模态Reward对齐的技术思路。在后训练阶段,智象采用Diffusion RL技术,并设计与人工认知对齐的多模态Reward模型。这套训练链路背后是DMSampler、DiffusionCompass、EvoID三篇论文,分别收录于2026年ICML、ECCV、CVPR三大顶会,从扩散强化学习采样效率、生成质量控制和身份保持等方向提供技术支撑。
智象联合创始人兼CTO姚霆表示,视频生成的代际进化不仅仅是像素的提升和时长的延续,而在于模型是否真正理解创作者的意图和真实世界的物理规律;HiDream V1从架构设计之初便面向文本、视频与音频的统一表征,原生全模态技术使之从看得清、动得顺,迈向听得懂、说得准、演得连贯。
HiDream V1的意义不只是新增一个视频模型。围绕统一UiT(Unified Transformer)底座,智象已形成图像、视频、3D、具身四个模型方向:图像解决视觉生成与理解,视频进入时间维度,3D对应交互式环境,具身深入真实动作与具身反馈。此前,HiDream-O1-Image商用版1.5在Artificial Analysis文生图榜取得中国第一、全球第三;HiDream-O1-World在交互式世界模型基准WBench的Navi分榜以平均分80.9位列第一,物理一致性73.3分同样第一;HiDream-O1-Embodied在RoboColiseum的Robustness子榜以平均分0.692登顶。这些模型共享UiT统一底座,文本、图像、视频、3D与具身数据能够在同一个表征空间里处理。
智象联合创始人兼CEO梅涛谈及路线时表示,智象致力于构建一个原生全模态底座、四大模型同源演进的模型矩阵,所构建的不是四条彼此独立的能力线,而是一套以统一技术架构为底座、面向世界模型持续进化、走向可落地的原生全模态体系。
从产业视角看,视频生成正从单一内容创作走向影视、广告、电商等生产场景,行业竞争重点也在变化。除了画质、时长和人物一致性等基础要求,模型对复杂运动、物理规律等真实世界的理解正成为新的竞争维度。视频所记录的是现实世界不断变化的过程,当模型能进一步理解时间、空间、物理规律以及因果关系,视频生成所覆盖的能力边界也会随之扩大,逐渐成为模型理解和模拟真实世界的一种路径。HiDream V1的发布,让智象的原生全模态世界模型矩阵补上了视频这一块重要拼图,也让其一个底座、四大模型同源演进的布局真正显现出来。