商汤大装置与多模态生成式AI企业智象未来(HiDream.ai)近期宣布,双方已跑通视频生成业务从国外GPU到国产算力的完整迁移链路,实现业务无感切换。这一合作不仅解决了国产算力在真实生产环境中的适配难题,也为AI企业大规模采用国产芯片提供了可复用的工程样板。

对于以图像、视频生成模型为核心业务的AI企业而言,国产化迁移并非简单更换GPU。视频生成模型参数规模大、推理链路长、计算密集度高,从底层算力、推理框架到模型性能、生成效果和工具链,每一环都可能成为卡点。智象未来作为全球领先的多模态生成式AI企业,其自研HiDream系列大模型已覆盖商业营销、影视创作、内容创作等场景,产品服务全球100多个国家和地区的超过5000万名专业用户及4万余家企业客户。此次与商汤大装置的合作,正是围绕其重点业务展开的国产算力适配验证。

商汤大装置从底层算力替代出发,深入模型推理、性能优化、生成效果等关键环节,通过全栈技术适配与FDE(Forward Deployed Engineer)专家服务,帮助智象未来在国产算力环境下平稳运行。针对视觉生成应用对性能的高要求,双方设定了明确业务指标:在国产算力环境下实现高清视频高效生成,并将端到端生成时长优化至业内领先水平。

为实现这一目标,商汤大装置团队基于LightX2V进行了多卡并行优化,并探索多机多卡扩展能力。通过训练-推理联合优化思路,采用步数蒸馏、CFG蒸馏等训练方案,在保持视频质量的同时显著提升推理速度。推理过程中引入CFG双分支并行、Ulysses序列并行、TP并行等多层次并行策略,对计算任务进行拆解与协同调度,最终在国产芯片运行DiT模型的场景下,多卡并行视频生成加速比达到93%,充分释放了国产算力性能。

然而,性能提升只是第一步。如果模型迁移后生成的人物表情、动作、细节出现明显变化,国产化迁移仍难以真正进入生产环境。双方团队发现,同一模型在单卡和多卡环境下可能存在细微的生成效果差异,例如人物表情特征表现不同。为此,商汤大装置优化多卡通信过程,通过重新注入Face特征等方式,加强多卡推理过程中的特征一致性,使多卡生成效果向单卡对齐。此外,针对部分视频尾帧手指等细节不清晰的问题,团队排查发现与模型训练和推理阶段视频帧数差异有关,通过补齐和优化推理过程,改善了长视频生成的细节表现。

除了单一芯片适配,智象未来还需应对不同国产芯片之间的异构适配挑战。商汤大装置构建了统一的硬件抽象体系,通过异构硬件初始化、统一设备抽象层、Registry调度工厂、硬件算子插件等,屏蔽了不同底层硬件的差异,实现“一次开发,多平台适配”,目前已支持10余种异构芯片上的模型零成本迁移。同时,商汤大装置完成了ComfyUI等主流AI开发工具生态适配,用户无需改变原有工作流和开发习惯,即可在国产算力平台完成应用开发与部署,大幅降低迁移和开发成本。

对于AI科创企业而言,模型研发和产品迭代本身已需大量资源,若再投入人力完成国产化适配,将增加额外成本。商汤大装置通过FDE专家服务模式,将专业工程能力深入智象未来业务场景,组织团队参与从模型迁移、算子优化、多卡并行到生成效果调优、工具链适配的全过程,围绕实际业务指标逐项排查和解决问题。这种“算力平台+工程专家”的协同方式,帮助AI企业减少国产化迁移的工程投入,将更多研发资源聚焦于模型创新与产品迭代。

目前,智象未来图像模型已完成国产算力适配验证,并支撑规模化线上流量及短视频创作。此次合作验证了国产算力支撑视频生成业务的可复用路径:以底层异构算力为基础,以统一硬件抽象体系和开发工具适配为连接,以模型性能与生成效果优化为核心,通过FDE专家服务深入业务现场,实现从全栈适配、技术验证到规模生产的完整闭环。未来,双方还将围绕更多AI应用场景深化合作,推动国产算力从“能用”加速迈向“好用”。