在AI行业Coding赛道陷入价格战与估值回调的当下,视觉多模态领域却迎来资本密集押注。智象未来(HiDream.ai)近日宣布完成15亿元C轮融资,由社保基金四川振兴科创基金工银资本、弘颐资管、敦鸿资本联合领投,厦门国贸资本、上影新视野基金、湖北长江产业投资集团、华策影视等跟投,老股东合肥产投、东方富海、金浦投资等持续加注。这已是该公司近三个月内完成的第三轮融资,累计融资额超过21亿元,估值跻身全球AI独角兽行列。

此次融资的资本结构呈现罕见的复合特征:国家队耐心资本(社保基金)、金融国家队(工银资本)、影视产业国家队(华策影视、上影新视野)、头部产业资本与市场化VC同时入局。这种多元资本组合在AI多模态模型赛道中并不多见,反映出投资方对视觉生成作为下一代世界模型入口战略价值的共识。

与Coding赛道不同,视觉多模态领域的竞争已从单一模型参数竞赛升级为综合能力比拼。数据壁垒更高——高质量图像、视频、影视素材涉及版权与IP规范;工程壁垒更复杂——需处理空间、时间、运动、光影、物理规律及多主体交互;评价体系更多维——审美、镜头语言、风格一致性、可控性缺一不可;工作流绑定更深——一旦嵌入影视制作、广告营销、电商内容生产流程,迁移成本极高。这些特性使得头部厂商更容易构建护城河。

智象未来在今年WAIC上发布的vivago R1,是全球首个无限时长内容创作智能体。其底层采用多Agent协作架构:调度层像总导演只记录角色设定与叙事主线;中间层是编剧、导演、设计师等专家Agent,各自拥有独立记忆;执行层负责分段并发生成,某一段失败只重试该段,不影响整体。这一架构与Claude Code的多Agent协作思路类似,但解决的是长链路视频创作而非代码开发。

实测显示,vivago R1能将“创作一段1分钟连续叙事生活短片”的指令自动拆解为多场景、多镜头叙事,并保持角色一致性、电影级画面质感与连贯动作。其内容有效可用成功率提升至85%,达到商业规模化交付门槛。目前,vivago海外版已覆盖5000万用户、100多个国家和地区,今年5月灰度版登顶Product Hunt日榜第一,拥有百万级付费用户

智象未来的技术路线指向世界模型——让AI不仅能生成内容,还能理解物理规律、推演因果关系、预测动作后果。创始人梅涛认为,真正的世界模型必须同时具备表达世界、推演世界、构造世界三种能力。公司自研的UiT架构(Unified Transformer)摒弃传统VAE图像压缩和独立文本编码器,将图像像素、文本Token、视频体素、音频、动作、空间关系等原始信号映射进同一共享Token空间,实现原生全模态统一建模。这一方向与谷歌2026年初发布的Gemini Embedding 2、英伟达的Nemotron 3 Nano Omni等全球科技巨头的布局不谋而合。

视觉多模态赛道的崛起,正在改写AI产业的资本叙事。当Coding赛道因同质化竞争与Token价格战陷入估值回调时,视觉生成凭借更高的数据壁垒、更深的工作流绑定和更复杂的评价体系,展现出更强的商业确定性与成长性。智象未来的融资案例表明,资本正从“模型参数竞赛”转向押注“世界模型”这一更长期的AGI路径。