商湯科技今日正式開源輕量級、原生統一多模態大模型 SenseNova U1.5 Lite。與預覽版(U1.5 Lite Preview)相比,正式版更強調能力能否準確、穩定地進入真實視覺創作流程,圍繞真實視覺任務重新完善了訓練資料、任務設計與後訓練流程,強化了視覺質量、複雜指令遵循、文字與佈局、原生4K、影像編輯和精細視覺控制等能力,旨在推動AI視覺生成跨越到“穩定完成真實視覺交付”的新階段。目前模型已面向全球開源,開發者與創作者可通過 GitHub、Hugging Face、魔搭社群 等渠道直接部署體驗,也可在 SenseNova Studio 線上試用。
在真實創作場景中,創作者常遇到兩大痛點:一是精心撰寫的長指令無法被模型完整解析,二是區域性編輯時模型會連帶改動無關區域。SenseNova U1.5 Lite 針對性地解決了這些問題。它原生支援 3-4k 字元的超長複雜指令遵循,打破了多數開源模型在指令超過1k字元時易崩潰、遺漏細節的瓶頸,能夠同時處理主體、數量、空間關係、文字、佈局、風格等多重約束。在影像編輯方面,模型增強了主體身份、空間結構、版式關係和非編輯區域的保持,支援區域性修改、元素替換、文字精修和多參考圖編輯。此外,模型還加強了中英文文字、海報、資訊圖、品牌視覺及多文本排版能力,支援 Bounding Box、Visual Marker 以及單圖、多圖參考等精細視覺控制方式,並實現了原生 4K 高解析度輸出,在高解析度生成中兼顧整體構圖與極精細的肌理、微小文字與光影折射。
官方展示的實戰案例覆蓋了複雜視覺表達、原生影像編輯、多參考圖融合、資訊圖編輯、文字編輯及指定區域精細編輯等場景。例如,在創意海報生成中,模型展現出高精度的複雜佈局能力,能精準掌控文字與留白節奏,並維持光影的自然連貫;在高密度資訊圖生成中,能保證中英文、資料等細節準確無誤,實現複雜資訊視覺化圖表的高質量一次性交付。在影像編輯案例中,模型能夠將手繪草圖渲染成復古暖色調漫畫,同時嚴格遵循超長指令中的分鏡、文字、配色等細節;也能在跨主題遷移時保持原海報的版式框架;還能將多張美食參考圖融合為一張完整海報,自動匹配背景、餐盤質感與環境光。在文字編輯方面,模型能夠精準替換畫面中的特定文字,同時嚴格保留周圍元素,如將黑板選單上的“快樂檸檬水”替換為“草莓啵啵奶茶”,並保持原有粉筆質感。
作為 8B 引數的輕量化模型,SenseNova U1.5 Lite 在指令遵循與影像編輯保持度上超越了同量級模型,並在文字渲染與複雜佈局上達到媲美超大規模商業模型的交付水平。傳統上,業界常採用顯式 Router 或多專家協同機制來分配渲染、美學、編輯等不同視覺任務,但這會增加系統開銷與推理時延。SenseNova U1.5 Lite 基於 NEO-unify 統一架構,通過解耦訓練與交付(MOPD 蒸餾)技術,在訓練階段獨立訓練文字、美學、編輯專家模型,交付階段通過多專家線上策略蒸餾技術將多專家能力無損融合至單體 8B 模型中。同時,模型實現了理解與生成雙向反哺,視覺語義理解與空間建模形成的認知直接反哺生成,使其能自然消化多層級指令,並在多模態理解榜單上保持強勁表現。得益於 8B 引數量,模型支援單卡流暢執行,無需 Router 頻繁切換,單次 Pass 即可兼顧語義理解與畫素生成,極大降低了呼叫成本與推理延遲。
正式版還強化了任務導向的強化學習(RL)後訓練,聚焦最佳化指令遵循、視覺偏好和編輯保持三大維度。指令遵循方面,模型能輕鬆解析超長 Prompt,精準執行嚴苛的多重複雜限制;視覺偏好方面,全面最佳化構圖、材質與光影,提升畫面質感與視覺完成度;編輯保持方面,實現畫素級區域性修改,完美保留非目標區域的內容與結構。這種複雜指令跟隨與精細編輯能力的結合,使得 SenseNova U1.5 Lite 在實際創作中能夠更穩定地執行使用者的完整意圖,減少“區域性正確但整體完成度不足”的情況。
商湯此次開源 SenseNova U1.5 Lite,不僅為開發者提供了高性價比的視覺生成工具,也展示了其在多模態大模型領域的技術積累。通過輕量化設計和統一架構,模型在保持高效能的同時降低了部署門檻,有望吸引更多中小團隊和個人創作者使用,推動 AI 視覺生成在真實工作流中的落地。隨著開源生態的完善,這類模型或將加速 AI 在廣告、設計、影視等創意產業的應用滲透。