AI News

Google DeepMind 已經證明,文字擴散模型不一定需要全新的大規模預訓練。根據 The Decoder 報導的一份技術報告,該公司說明了如何以不到原始模型訓練 token 預算 10% 的成本,把既有的 Gemma 4-26B-A4B 轉換成 DiffusionGemma。

這套系統會平行生成最多 256 個 token 的區塊,而不是一次只生成一個 token。Google 在 Nvidia H100 上回報的吞吐量約為每秒 1,500 個 token。這裡的取捨很重要:DiffusionGemma 在整體基準品質上仍落後於其自迴歸前身,但這種做法可能為研究人員與產品團隊提供一條更便宜的文字擴散實驗路徑。

不是重新預訓練,而是改裝

傳統的自迴歸語言模型會依序建構回應,根據已產生的 token 預測下一個 token。DiffusionGemma 採取不同路徑,反覆精修一個帶有雜訊的文字區塊,直到輸出可用為止。雖然它應用在語言上,但其方法在精神上更接近影像擴散系統。

Google DeepMind 並不是專門為擴散而設計並訓練一個新模型,而是從 Gemma 4 出發。第一階段訓練教會模型復原被破壞的文字區塊。第二階段結合了強化學習與取樣器蒸餾,Google 稱之為 SD·RL。強化學習用來改善回應,而取樣器蒸餾則減少了推論時所需的精修步驟數。

這個設計選擇是報告中的核心新聞。它暗示既有語言模型可以作為不同生成機制的基礎,進而可能降低探索替代架構所需的成本與時間。不過,這並不能證明後續改裝能夠穩定追上從一開始就為擴散訓練的模型。

平行生成帶來速度,但有前提

報告指出,SD·RL 在改造後的系統中,將推理基準的結果平均提升了 10 分,同時幾乎將每個計算步驟可處理的 token 數量提高四倍。根據 Google 的說法,DiffusionGemma 的回應也大約短了 50%,這進一步支撐了其速度主張。

據報導,該模型可在擴散式生成與原本逐字生成模式之間切換。這種彈性可讓應用在結構化任務上使用反覆精修,而在序列式生成較可靠的地方使用傳統解碼。

最強的效能數據仍然來自供應商報告。The Decoder 表示,DiffusionGemma 在單一使用者條件下於 H100 上可達每秒約 1,500 個 token。隨著併發增加,優勢會縮小:約 32 個同時請求時,標準語言模型據稱會在吞吐量上追平。這也使得部署設計與標題中的速度數字同等重要。

證據、改進與已知弱點

Google 的報告指出了幾項平行精修可能有用的任務。在一個數學範例中,擴散模型可以在最終確定可見輸出之前先發展出答案,使其得以修正早期錯誤,而不是事後再附上一段更正。報告也描述了在最少微調後,數獨表現接近 85%,而基礎模型據稱無法完成該任務。

結構化輸出可能是特別實用的應用場景。Google 表示,當最終結構的大部分已被輸入限制住時,JSON 生成與程式碼修復可在兩到三個精修步驟內完成。這些結果令人鼓舞,但它們是模型技術報告中的任務特定主張,而非獨立評測。

報告也記錄了重要限制。DiffusionGemma 有時會陷入重複迴圈,甚至重複單個字詞。模型的訓練階段相對短暫,而 SD·RL 階段偏好較低的計算需求,而非最高品質。由於架構、資料與其他設定皆沿用自 Gemma 4,它們未必是擴散生成的最佳配置。

The Decoder 進一步指出,該模型在多模態任務中有時無法完整收束其推理段落,導致測得分數下降,而這些原因可能未必反映底層答案本身。整體表現仍低於自迴歸基礎模型,Google 部分將此歸因於改裝策略與有限的後續訓練。

對開發者與企業團隊的意義

對 AI 開發者而言,DiffusionGemma 提供的是具體的研究起點,而不是傳統語言模型的成熟替代品。正在研究低延遲助理、受限生成或互動式系統的團隊,可以測試平行精修是否能縮短回應時間,同時不會帶來無法接受的重複或準確度問題。

經濟性取決於工作負載的形狀。單一使用者應用可能最能受益於其回報的吞吐量,而高併發服務的優勢可能較小。團隊也需要測量總延遲、精修步驟數、加速器利用率與修正率,而不能只看每秒 token 數。

結構化工作流程似乎比開放式推理更適合這種方法。JSON 產生、程式碼修復以及其他有強約束輸入的任務,可能只需要較少的去噪迭代。相反地,若應用依賴持續穩定的推理能力或潤飾過的長篇回答,則在擴散專屬訓練提升品質前,可能仍會偏好原本的自迴歸模型。

該模型以 Apache 2.0 授權在 Hugging Face 上提供,降低了實驗門檻。The Decoder 報導,Interfaze 已經將其用於多語言語音辨識,而另一項研究計畫則在探索互動式放射報告生成。這些都是早期採用訊號,而非廣泛生產部署的證據,且現有來源也未提供其效能或規模的獨立細節。

接下來要觀察什麼

下一個重要訊號將是,專門為文字擴散訓練的模型,是否能縮小與改裝系統之間的品質差距。研究人員也應在真實的併發工作負載下測試 DiffusionGemma,而不只是單一請求的基準。

進一步評估應檢視重複失敗、結構化輸出的有效性、推理準確度,以及每個完成任務的能耗或成本。同時也值得觀察,專門的微調是否能在程式撰寫、語音辨識與企業文件生成方面帶來可靠改善。

Google 先前的 Gemini Diffusion 展示顯示,該公司仍在持續研究這種方法,但 DiffusionGemma 明確被描述為實驗性質。因此,這個模型的價值可能不在於立刻取代標準語言模型,而在於它能多快促成獨立研究與針對性改造。

Creati.ai 觀點

DiffusionGemma 之所以重要,是因為它把文字擴散重新定義為一個改造問題。從既有模型出發讓實驗更容易上手,但也暴露出重用為序列解碼所建立之架構與訓練配方的限制。

對產品團隊而言,實際問題不是平行生成是否普遍更快,而是某個特定工作流程是否足夠有結構,能在保留準確度與輸出可靠性的同時,從更少的精修步驟中受益。DiffusionGemma 讓開發者能以相對低的進入成本測試這個問題,但其基準落差與併發限制也說明,應該針對工作負載層級仔細評估,而不是泛泛宣稱要取代自迴歸模型。

精選

DiffusionGemma 展示了如何重用現有語言模型,以更快地生成文字

Google DeepMind 以遠低於原本訓練成本的代價,將 Gemma 4 改造成 DiffusionGemma,並以基準表現的些許犧牲換取更快的平行文字生成。