谷歌DeepMind近期釋出技術報告,詳細介紹瞭如何將現有的Gemma 4模型改造為擴散模型DiffusionGemma,而無需從頭訓練。這一方法大幅降低了訓練成本,僅使用不到原始訓練預算的10%,便在輝達H100加速器上實現了每秒約1500 token的生成速度,同時保持與原始模型相當的準確率。

DiffusionGemma於6月中旬作為模型釋出,此次報告則揭示了其背後的技術細節。與標準語言模型逐token生成文本不同,DiffusionGemma採用並行方式,一次精煉256個token的塊,類似於影像生成AI從噪聲中逐步還原影像的過程。這種設計使其輸出速度比Gemma 4模型及以往的擴散模型快數倍。

訓練過程分為兩個階段。第一階段,模型學習從示例資料中重建被噪聲汙染的文本塊。第二階段,谷歌將強化學習與取樣器蒸餾結合,稱為SD·RL。強化學習通常能提升回答質量,而取樣器蒸餾則減少計算步驟,兩者合併為單一流程。報告稱,這種方法在推理基準測試上平均提升了10個點,同時每個計算步驟生成的token數量幾乎翻了兩番。作為副作用,DiffusionGemma的回答長度縮短了約50%,進一步提升了速度。

擴散模型的另一個優勢在於雙向推理能力。標準語言模型在推理過程中必須逐字承諾答案,而DiffusionGemma可以並行開發答案和推理過程,在輸出最終結果前修正錯誤。例如,在解決數獨問題時,經過最小微調,DiffusionGemma能正確解決近85%的謎題,而基礎模型完全無法完成該任務。對於結構化輸出(如JSON或程式碼修復),由於輸入已確定大部分token,通常只需2到3個精煉步驟即可完成。此外,DiffusionGemma保留了逐詞生成文本的能力,使用者可根據任務需求在兩種模式間切換。

儘管在速度上領先,DiffusionGemma在絕對效能上仍不及自迴歸的Gemma 4模型。谷歌指出了幾個原因:模型並非從一開始就作為擴散模型訓練,而是事後改造;後續訓練階段相對較短,且SD·RL階段優先考慮速度而非峰值質量;架構、訓練資料等設定沿用了原始Gemma 4,未必適合擴散模型。模型偶爾會陷入重複迴圈,連續生成相同單詞,這是計算步驟大幅減少的副作用。在多模態任務中,DiffusionGemma有時會忘記正確關閉推理部分,從而拉低基準分數。此外,速度優勢主要適用於單使用者場景,當併發請求達到約32個時,標準語言模型的吞吐量將追上。

谷歌明確將DiffusionGemma定位為實驗性模型,旨在加速文本擴散研究,併為社群提供資源高效的專業化適配基礎。該模型已在Hugging Face上以Apache 2.0許可證開源,並被初創公司Interfaze用於多語言語音識別,以及一個互動式放射學報告生成研究專案。其前身是谷歌在2025年5月演示的Gemini Diffusion。這一研究展示了在不從頭訓練的情況下構建文本擴散模型的可行性,可能為未來模型迭代提供更經濟的路徑。