商汤科技今日正式开源其8B参数多模态模型SenseNova U1.5 Lite,官方宣称该模型在复杂排版、精准编辑等核心场景上比肩闭源的GPT-Image-2。这是继三周前发布Preview版本后的正式版本,商汤在训练阶段引入了多教师在线策略蒸馏技术(MOPD),将多个专项Expert的能力融合回同一个轻量级模型中,以提升指令遵循、视觉偏好和编辑精度。
在官方展示的案例中,SenseNova U1.5 Lite能够将多张比例、背景各异的图片整合到一张设计图中,并精准识别菜品、进行美化;也能通过“框选+标注”方式对图片局部进行修改,同时保持非编辑区域的空间关系基本不变。在复杂信息图生成任务中,模型需要同时组织长文本、多层级结构、插画和版式关系,例如将Harvesting、Fermentation、Roasting、Grinding、Tempering到Finished Chocolate六个阶段完整呈现。在仿照参考图的任务中,模型需区分主题内容与底层设计逻辑,保留后者并让新内容沿原视觉语言生成,例如将教育项目元素替换为厨房相关视觉,同时更新左侧信息。
针对多参考图任务,模型需分别理解版式风格、人物身份和文字内容,再合成到一张图中。例如在Radiohead海报案例中,模型将五个人物融入原乐队区域,并重新压缩左下角信息,使“ESSENTIAL LISTENING”融入右侧版面。对于简单的文字替换需求,模型也能保持原有字体样式和排版布局不变,仅更新指定区域的内容。
SenseNova U1.5 Lite继续沿用NEO-unify原生统一多模态架构,将视觉理解、图像生成和编辑置于同一模型内。训练阶段采用“先拆开练,再合回来”的策略:先训练多个专项Expert,再通过MOPD技术将其能力融合回同一个模型。最终交付时,用户获得的仍是一个8B模型,无需外部路由判断调用哪个子模型,也无需在不同模型间切换。商汤在新闻稿中将此概括为“理解与生成双向反哺”,即视觉语义理解和空间建模形成的结构化认知有助于生成和编辑。
模型还引入了提示词增强(PE)功能,用户只需给出简短需求,PE可将其整理成更完整的创作方案再交给模型执行。商汤强调,随着AI生图能力普及,模型能否进入真实工作流的关键在于从生成到交付的完整链路,包括指令遵循、视觉偏好和编辑精度。SenseNova U1.5 Lite最终仍保持8B参数,没有叠加外部路由或拆分任务,而是通过专项Expert补强能力后重新收进统一模型,以缩短调用链路、减轻部署负担,并保持任务间一致性。
商汤认为,多模态仍是AI走向物理世界、进入生产环节的重要方向,因此本次正式版将大量精力放在稳定性、指令遵循和编辑精度上。这些能力未必像新玩法那样第一眼抓人,却直接决定模型能否被真正应用。模型已开源,提供GitHub、Hugging Face仓库及SenseNova Studio在线体验。