商湯科技今日正式開源其8B引數多模態模型SenseNova U1.5 Lite,官方宣稱該模型在複雜排版、精準編輯等核心場景上比肩閉源的GPT-Image-2。這是繼三週前釋出Preview版本後的正式版本,商湯在訓練階段引入了多教師線上策略蒸餾技術(MOPD),將多個專項Expert的能力融合回同一個輕量級模型中,以提升指令遵循、視覺偏好和編輯精度。
在官方展示的案例中,SenseNova U1.5 Lite能夠將多張比例、背景各異的圖片整合到一張設計圖中,並精準識別菜品、進行美化;也能通過“框選+標註”方式對圖片區域性進行修改,同時保持非編輯區域的空間關係基本不變。在複雜資訊圖生成任務中,模型需要同時組織長文本、多層級結構、插畫和版式關係,例如將Harvesting、Fermentation、Roasting、Grinding、Tempering到Finished Chocolate六個階段完整呈現。在仿照參考圖的任務中,模型需區分主題內容與底層設計邏輯,保留後者並讓新內容沿原視覺語言生成,例如將教育專案元素替換為廚房相關視覺,同時更新左側資訊。
針對多參考圖任務,模型需分別理解版式風格、人物身份和文字內容,再合成到一張圖中。例如在Radiohead海報案例中,模型將五個人物融入原樂隊區域,並重新壓縮左下角資訊,使“ESSENTIAL LISTENING”融入右側版面。對於簡單的文字替換需求,模型也能保持原有字型樣式和排版佈局不變,僅更新指定區域的內容。
SenseNova U1.5 Lite繼續沿用NEO-unify原生統一多模態架構,將視覺理解、影像生成和編輯置於同一模型內。訓練階段採用“先拆開練,再合回來”的策略:先訓練多個專項Expert,再通過MOPD技術將其能力融合回同一個模型。最終交付時,使用者獲得的仍是一個8B模型,無需外部路由判斷呼叫哪個子模型,也無需在不同模型間切換。商湯在新聞稿中將此概括為“理解與生成雙向反哺”,即視覺語義理解和空間建模形成的結構化認知有助於生成和編輯。
模型還引入了提示詞增強(PE)功能,使用者只需給出簡短需求,PE可將其整理成更完整的創作方案再交給模型執行。商湯強調,隨著AI生圖能力普及,模型能否進入真實工作流的關鍵在於從生成到交付的完整鏈路,包括指令遵循、視覺偏好和編輯精度。SenseNova U1.5 Lite最終仍保持8B引數,沒有疊加外部路由或拆分任務,而是通過專項Expert補強能力後重新收進統一模型,以縮短呼叫鏈路、減輕部署負擔,並保持任務間一致性。
商湯認為,多模態仍是AI走向物理世界、進入生產環節的重要方向,因此本次正式版將大量精力放在穩定性、指令遵循和編輯精度上。這些能力未必像新玩法那樣第一眼抓人,卻直接決定模型能否被真正應用。模型已開源,提供GitHub、Hugging Face倉庫及SenseNova Studio線上體驗。