Google's DiffusionGemma proves you don't need to train from scratch to build a text diffusion model

Google's DiffusionGemma proves you don't need to train from scratch to build a text diffusion model

AI News Bot
2026-08-10
預計閱讀 1 分鐘原文來源

Google 的 DiffusionGemma 技術:無需從零開始即可建造文字擴散模型

Google DeepMind 近期發布了一份技術報告,介紹了 DiffusionGemma 的運作方式及其優勢。與標準語言模型不同,DiffusionGemma 能夠並行地修飾 256 個字元的文字塊,類似於圖像 AI 從雜亂中生成圖片的方式。在 Nvidia H100 加速器上,該模型每秒可處理約 1,500 個字元。

背景與技術細節

Google DeepMind 的團隊並非從零開始建造 DiffusionGemma,而是基於現有的 Gemma-4-26B-A4B 模型,並使用不到原始訓練字元預算的 10% 將其轉換為擴散模型。這個過程分為兩個階段:首先,模型學習如何從示例資料中重建雜亂的文字塊;其次,結合了強化學習和採樣蒸餾(sampler distillation)的階段,Google 稱之為 SD·RL。強化學習通常能夠提升答案質量,而採樣蒸餾則允許模型使用較少的計算步驟。Google 將這兩種方法合並為單一過程。

技術優勢與限制

根據報告,DiffusionGemma 的這種結合方法能夠在推理基準上提高質量平均 10 個百分點,並將每計算步驟的字元數量幾乎增加四倍。作為意外的副作用,DiffusionGemma 的答案大約縮短了 50%,進一步提升了速度。然而,標準語言模型必須在完成推理之前先提交答案的第一個字元,而 DiffusionGemma 則能夠並行地開發答案和推理,因此能夠在輸出最終結果之前糾正錯誤。

未來展望

雖然 DiffusionGemma 的絕對性能不及自回歸基礎模型,但 Google 指出這是因為 DiffusionGemma 沒有從一開始就被訓練為擴散模型,而是在事後改裝。訓練階段相對較短,SD·RL 步驟優先考慮速度而非最高質量。架構、訓練資料和其他設定都是從原始 Gemma 4 模型攜帶過來的,這些設定可能並不適合擴散模型。DiffusionGemma 仍然保留了其原始的逐字生成文字的能力,允許用戶根據任務在兩種模式之間切換。這項技術的發展為未來的語言模型帶來了新的可能性和挑戰。

分享