商汤科技今日正式开源轻量级、原生统一多模态大模型 SenseNova U1.5 Lite。与预览版(U1.5 Lite Preview)相比,正式版更强调能力能否准确、稳定地进入真实视觉创作流程,围绕真实视觉任务重新完善了训练数据、任务设计与后训练流程,强化了视觉质量、复杂指令遵循、文字与布局、原生4K、图像编辑和精细视觉控制等能力,旨在推动AI视觉生成跨越到“稳定完成真实视觉交付”的新阶段。目前模型已面向全球开源,开发者与创作者可通过 GitHub、Hugging Face、魔搭社区 等渠道直接部署体验,也可在 SenseNova Studio 在线试用。
在真实创作场景中,创作者常遇到两大痛点:一是精心撰写的长指令无法被模型完整解析,二是局部编辑时模型会连带改动无关区域。SenseNova U1.5 Lite 针对性地解决了这些问题。它原生支持 3-4k 字符的超长复杂指令遵循,打破了多数开源模型在指令超过1k字符时易崩溃、遗漏细节的瓶颈,能够同时处理主体、数量、空间关系、文字、布局、风格等多重约束。在图像编辑方面,模型增强了主体身份、空间结构、版式关系和非编辑区域的保持,支持局部修改、元素替换、文字精修和多参考图编辑。此外,模型还加强了中英文文字、海报、信息图、品牌视觉及多文本排版能力,支持 Bounding Box、Visual Marker 以及单图、多图参考等精细视觉控制方式,并实现了原生 4K 高分辨率输出,在高分辨率生成中兼顾整体构图与极精细的肌理、微小文字与光影折射。
官方展示的实战案例覆盖了复杂视觉表达、原生图像编辑、多参考图融合、信息图编辑、文字编辑及指定区域精细编辑等场景。例如,在创意海报生成中,模型展现出高精度的复杂布局能力,能精准掌控文字与留白节奏,并维持光影的自然连贯;在高密度信息图生成中,能保证中英文、数据等细节准确无误,实现复杂信息可视化图表的高质量一次性交付。在图像编辑案例中,模型能够将手绘草图渲染成复古暖色调漫画,同时严格遵循超长指令中的分镜、文字、配色等细节;也能在跨主题迁移时保持原海报的版式框架;还能将多张美食参考图融合为一张完整海报,自动匹配背景、餐盘质感与环境光。在文字编辑方面,模型能够精准替换画面中的特定文字,同时严格保留周围元素,如将黑板菜单上的“快乐柠檬水”替换为“草莓啵啵奶茶”,并保持原有粉笔质感。
作为 8B 参数的轻量化模型,SenseNova U1.5 Lite 在指令遵循与图像编辑保持度上超越了同量级模型,并在文字渲染与复杂布局上达到媲美超大规模商业模型的交付水平。传统上,业界常采用显式 Router 或多专家协同机制来分配渲染、美学、编辑等不同视觉任务,但这会增加系统开销与推理时延。SenseNova U1.5 Lite 基于 NEO-unify 统一架构,通过解耦训练与交付(MOPD 蒸馏)技术,在训练阶段独立训练文字、美学、编辑专家模型,交付阶段通过多专家在线策略蒸馏技术将多专家能力无损融合至单体 8B 模型中。同时,模型实现了理解与生成双向反哺,视觉语义理解与空间建模形成的认知直接反哺生成,使其能自然消化多层级指令,并在多模态理解榜单上保持强劲表现。得益于 8B 参数量,模型支持单卡流畅运行,无需 Router 频繁切换,单次 Pass 即可兼顾语义理解与像素生成,极大降低了调用成本与推理延迟。
正式版还强化了任务导向的强化学习(RL)后训练,聚焦优化指令遵循、视觉偏好和编辑保持三大维度。指令遵循方面,模型能轻松解析超长 Prompt,精准执行严苛的多重复杂限制;视觉偏好方面,全面优化构图、材质与光影,提升画面质感与视觉完成度;编辑保持方面,实现像素级局部修改,完美保留非目标区域的内容与结构。这种复杂指令跟随与精细编辑能力的结合,使得 SenseNova U1.5 Lite 在实际创作中能够更稳定地执行用户的完整意图,减少“局部正确但整体完成度不足”的情况。
商汤此次开源 SenseNova U1.5 Lite,不仅为开发者提供了高性价比的视觉生成工具,也展示了其在多模态大模型领域的技术积累。通过轻量化设计和统一架构,模型在保持高性能的同时降低了部署门槛,有望吸引更多中小团队和个人创作者使用,推动 AI 视觉生成在真实工作流中的落地。随着开源生态的完善,这类模型或将加速 AI 在广告、设计、影视等创意产业的应用渗透。