谷歌DeepMind近期发布技术报告,详细介绍了如何将现有的Gemma 4模型改造为扩散模型DiffusionGemma,而无需从头训练。这一方法大幅降低了训练成本,仅使用不到原始训练预算的10%,便在英伟达H100加速器上实现了每秒约1500 token的生成速度,同时保持与原始模型相当的准确率。

DiffusionGemma于6月中旬作为模型发布,此次报告则揭示了其背后的技术细节。与标准语言模型逐token生成文本不同,DiffusionGemma采用并行方式,一次精炼256个token的块,类似于图像生成AI从噪声中逐步还原图像的过程。这种设计使其输出速度比Gemma 4模型及以往的扩散模型快数倍。

训练过程分为两个阶段。第一阶段,模型学习从示例数据中重建被噪声污染的文本块。第二阶段,谷歌将强化学习与采样器蒸馏结合,称为SD·RL。强化学习通常能提升回答质量,而采样器蒸馏则减少计算步骤,两者合并为单一流程。报告称,这种方法在推理基准测试上平均提升了10个点,同时每个计算步骤生成的token数量几乎翻了两番。作为副作用,DiffusionGemma的回答长度缩短了约50%,进一步提升了速度。

扩散模型的另一个优势在于双向推理能力。标准语言模型在推理过程中必须逐字承诺答案,而DiffusionGemma可以并行开发答案和推理过程,在输出最终结果前修正错误。例如,在解决数独问题时,经过最小微调,DiffusionGemma能正确解决近85%的谜题,而基础模型完全无法完成该任务。对于结构化输出(如JSON或代码修复),由于输入已确定大部分token,通常只需2到3个精炼步骤即可完成。此外,DiffusionGemma保留了逐词生成文本的能力,用户可根据任务需求在两种模式间切换。

尽管在速度上领先,DiffusionGemma在绝对性能上仍不及自回归的Gemma 4模型。谷歌指出了几个原因:模型并非从一开始就作为扩散模型训练,而是事后改造;后续训练阶段相对较短,且SD·RL阶段优先考虑速度而非峰值质量;架构、训练数据等设置沿用了原始Gemma 4,未必适合扩散模型。模型偶尔会陷入重复循环,连续生成相同单词,这是计算步骤大幅减少的副作用。在多模态任务中,DiffusionGemma有时会忘记正确关闭推理部分,从而拉低基准分数。此外,速度优势主要适用于单用户场景,当并发请求达到约32个时,标准语言模型的吞吐量将追上。

谷歌明确将DiffusionGemma定位为实验性模型,旨在加速文本扩散研究,并为社区提供资源高效的专业化适配基础。该模型已在Hugging Face上以Apache 2.0许可证开源,并被初创公司Interfaze用于多语言语音识别,以及一个交互式放射学报告生成研究项目。其前身是谷歌在2025年5月演示的Gemini Diffusion。这一研究展示了在不从头训练的情况下构建文本扩散模型的可行性,可能为未来模型迭代提供更经济的路径。