核心概述
近幾個月,**持續擴散模型(continuous diffusion models)**在語言生成領域重新受到關注。早期離散擴散(discrete diffusion)已一度取代了持續擴散的嘗試,但隨著新研究的湧入,潮流似乎正向後者傾斜。本文將說明這股回潮的技術根源與可能衝擊。
背景與技術演變
傳統的**大型語言模型(LLM)大多採用自回歸(autoregressive)**方式——一次產生一個 token,透過教師強制(teacher forcing)在訓練時平行化計算,成為目前最可擴展的配方。自回歸的缺點包括 曝光偏差(exposure bias)——模型在推論時必須自行產生前置 token,與在填補(infilling)或受限生成(constrained generation)情境下的適應性不足。
受到影像與音訊領域早期擴散成功的啟發,研究者在 2021 年嘗試將擴散概念搬到文字上,先以離散擴散(如 multinomial diffusion、D3PM、SUNDAE)取代連續噪聲的腐蝕過程,以處理類別型資料。當時 GPT‑3 剛出現,尚未形成「ChatGPT」的熱潮,離散擴散被視為解決自回歸理論缺陷的可行方案。
近期突破與影響
隨著 2022 年底 ChatGPT 的爆發,業界對自回歸模型的效能與商業價值有了更深認識,同時也暴露出其在長序列一致性與多樣性上的限制。近期多篇論文重新探索持續擴散的可能性,提出在語言空間加入漸進式高斯噪聲(Gaussian noise)的方法,並設計逆向去噪過程以一次性生成完整序列。這些工作顯示:
- 訓練效率:不再依賴教師強制,可減少序列長度對梯度傳遞的影響。
- 生成靈活度:自然支援填補與條件限制,因為整個序列同時被建模。
- 理論一致性:避免曝光偏差,生成過程更貼近真實資料分布。
雖然仍處於早期階段,持續擴散模型已在小規模語料上展現與自回歸模型相當的 perplexity(語言模型困惑度),且在多樣性評測上有明顯提升。
未來展望
若持續擴散的訓練成本能進一步降低,未來可能與自回歸模型形成互補:在需要高速單詞預測的情境保留自回歸,在需要全局一致性或受限生成的任務轉向擴散。對於開發者與研究者而言,值得關注以下方向:
-
噪聲排程(noise schedule) 的最佳化設計。
-
混合架構:結合自回歸與擴散的雙模態模型。
-
大規模語料驗證:在百億參數規模下測試持續擴散的可擴展性。
總結來說,持續擴散模型正從沉寂走向舞台中心,未來的語言 AI 版圖或將因其多樣化的生成機制而更為豐富。讀者若對此議題感興趣,建議持續追蹤最新的 arXiv 論文與開源實驗,以掌握技術演進的第一手資訊。