2026 年 6 月,一个名为 Boogu-Image-0.1 的开源图像模型在 HuggingFace 上发布后迅速引发关注。这款模型以 10B 参数 的规模,在 Qwen-Image-Bench 基准测试中取得 53.58 分,领先于 20B 参数的 Qwen-Image-2512(52.06 分)和 80B 参数的 Hunyuan-Image-3.0(50.81 分)。以对手 1/8 甚至 1/2 的参数规模实现性能反超,打破了“更大即更强”的传统认知,也让业内对其实际应用价值充满好奇。

Boogu-Image-0.1 此次开源了四个版本:Base(核心文生图模型,擅长超密集文本渲染)、Turbo(蒸馏版,3-4 步快速生成)、Edit(面向图像编辑与图生图工作流)以及 FP8(量化部署版)。测评团队针对不同版本设计了贴近生产级任务的测试,包括照片级真实感生成、电影海报创作和局部编辑。

Turbo 版本的测试中,模型生成的游客照、生日聚会场景和宠物动态照片均展现出超越参数规模的真实感。人物表情自然、光影处理得当,甚至带有手机抓拍的生活气息。但在细节上,如菜品摆放、蛋糕上的文字,以及影子的物理表现,仍存在失真问题。

Base 版本被用于生成《花样年华》风格的港风电影海报,以考察其文字处理、构图和氛围营造能力。结果显示,Base 能准确遵循提示词,人物关系与光影氛围处理到位,但相比 ChatGPT Images 2.0,在文字排版、光源逻辑和电影质感上仍有明显差距。例如,Base 生成的画面右侧出现一条不合理的光带,而 ChatGPT Images 2.0 的光影则更符合物理逻辑。

Edit 版本的测试聚焦于真实生产中的修改需求。在替换人物服装、移除画面元素等任务中,模型能基本保持构图和氛围,但涉及复杂改动(如将动物替换为其他物种并融入光影)时,稳定性明显下降,出现“贴图感”或非预期形变。这类问题在基准测试中不会扣分,但在实际改稿流程中可能打断工作流。

除了画质,Boogu-Image 还通过 FP8 原生量化版本 降低了部署成本。FP8 相比 FP16/BF16 位宽更低,有助于减少权重存储和计算开销,为批量生成、Agent 视觉模块等高频调用场景提供了更经济的路径。

综合来看,Boogu-Image-0.1 在跑分上的反超体现了工程能力,但在真实交付中仍面临挑战。文字渲染是当前图像模型的普遍难点,尤其是中文等笔画密集的文字,容易在压缩和重建过程中丢失细节。此外,模型在图像叙事和心理情绪的解构上,与顶级闭源模型存在差距,这与其采用 VAE 潜空间路线的有损压缩有关。局部编辑的不可预期性也是其短板,修改可能牵动周围光影和构图,导致非预期形变。

尽管存在不足,Boogu-Image-0.1 以 10B 参数实现的高性能,仍为图像生成模型的轻量化部署提供了新思路。其能否在生产级场景中站稳脚跟,还需更多实际应用的检验。