2026 年 6 月,一個名為 Boogu-Image-0.1 的開源影像模型在 HuggingFace 上釋出後迅速引發關注。這款模型以 10B 引數 的規模,在 Qwen-Image-Bench 基準測試中取得 53.58 分,領先於 20B 引數的 Qwen-Image-2512(52.06 分)和 80B 引數的 Hunyuan-Image-3.0(50.81 分)。以對手 1/8 甚至 1/2 的引數規模實現效能反超,打破了“更大即更強”的傳統認知,也讓業內對其實際應用價值充滿好奇。
Boogu-Image-0.1 此次開源了四個版本:Base(核心文生圖模型,擅長超密集文本渲染)、Turbo(蒸餾版,3-4 步快速生成)、Edit(面向影像編輯與圖生圖工作流)以及 FP8(量化部署版)。測評團隊針對不同版本設計了貼近生產級任務的測試,包括照片級真實感生成、電影海報創作和區域性編輯。
在 Turbo 版本的測試中,模型生成的遊客照、生日聚會場景和寵物動態照片均展現出超越引數規模的真實感。人物表情自然、光影處理得當,甚至帶有手機抓拍的生活氣息。但在細節上,如菜品擺放、蛋糕上的文字,以及影子的物理表現,仍存在失真問題。
Base 版本被用於生成《花樣年華》風格的港風電影海報,以考察其文書處理、構圖和氛圍營造能力。結果顯示,Base 能準確遵循提示詞,人物關係與光影氛圍處理到位,但相比 ChatGPT Images 2.0,在文字排版、光源邏輯和電影質感上仍有明顯差距。例如,Base 生成的畫面右側出現一條不合理的光帶,而 ChatGPT Images 2.0 的光影則更符合物理邏輯。
Edit 版本的測試聚焦於真實生產中的修改需求。在替換人物服裝、移除畫面元素等任務中,模型能基本保持構圖和氛圍,但涉及複雜改動(如將動物替換為其他物種並融入光影)時,穩定性明顯下降,出現“貼圖感”或非預期形變。這類問題在基準測試中不會扣分,但在實際改稿流程中可能打斷工作流。
除了畫質,Boogu-Image 還通過 FP8 原生量化版本 降低了部署成本。FP8 相比 FP16/BF16 位寬更低,有助於減少權重儲存和計算開銷,為批次生成、Agent 視覺模組等高頻呼叫場景提供了更經濟的路徑。
綜合來看,Boogu-Image-0.1 在跑分上的反超體現了工程能力,但在真實交付中仍面臨挑戰。文字渲染是當前影像模型的普遍難點,尤其是中文等筆畫密集的文字,容易在壓縮和重建過程中丟失細節。此外,模型在影像敘事和心理情緒的解構上,與頂級閉源模型存在差距,這與其採用 VAE 潛空間路線的有失真壓縮有關。區域性編輯的不可預期性也是其短板,修改可能牽動周圍光影和構圖,導致非預期形變。
儘管存在不足,Boogu-Image-0.1 以 10B 引數實現的高效能,仍為影像生成模型的輕量化部署提供了新思路。其能否在生產級場景中站穩腳跟,還需更多實際應用的檢驗。