預計閱讀 1 分鐘原文來源
開源大型語言模型強化學習系統發布
一支研究團隊近日公開了 全套開源 的大型語言模型(LLM)強化學習(RL)系統,涵蓋演算法、程式基礎建設與訓練資料集。此系統以 verl 框架為底,結合 Ray Serve 與 vLLM 兩大部署工具,讓研究者能在可擴展的環境下直接復現最先進的 RL 成果。
DAPO 演算法與關鍵創新
核心演算法命名為 Decoupled Clip and Dynamic sAmpling Policy Optimization(DAPO)。其設計重點包括:
- 分離式 Clip:將策略梯度的裁剪(Clip)機制與獎勵正則化解耦,提升大模型在高維參數空間的收斂穩定性。
- 動態抽樣:根據回饋信號自適應調整樣本抽樣機率,讓模型在訓練過程中能持續探索較長的回應長度,進而學習更複雜的推理行為。
實驗顯示,使用 Qwen2.5‑32B 為基礎模型的 DAPO‑Qwen‑32B 在 AIME 2024 評測上取得 50 分,相較於先前的 DeepSeek‑R1‑Zero‑Qwen‑32B(僅使用 50% 訓練步驟)即突破最高紀錄。
- 回饋分數穩定提升:獎勵訊號呈現持續上升,說明模型已成功擬合訓練分布,學習過程不易出現劇烈波動。
- 熵與平均機率走勢:熵值在初期下降後緩慢回升,保持適度的探索與利用平衡,避免過度擬合或隨機性過高。
- 回應長度穩定成長:隨著訓練迭代,模型生成的答案長度逐步延長,促進更深入的推理與解題能力。
開源資源與實驗環境
- 模型權重:已於 Huggingface 公布 DAPO‑Qwen‑32B 完整權重,支援直接從雲端或本機路徑載入。
- 資料集:提供 DAPO‑Math‑17k(精挑細選的數學題目集)作為訓練資料,驗證集則採用 AIME 2024。
- 環境建置:建議使用 conda 進行相依套件安裝,相關腳本與說明皆收錄於 README。
- 訓練腳本:包括「無 Token‑level PG Loss & 動態抽樣」版本(在 AIME 上取得 44 分)與「完整 DAPO」版本(取得 50 分),訓練過程可於 wandb 追蹤。
- 運算平台:實驗在 Volcano Engine 機器學習平台 上完成,提供完整的復現指南。
成效驗證與未來展望
此項開源計畫不僅讓學術界與產業界能即時取得最前沿的 LLM RL 技術,亦降低了大規模強化學習的門檻。透過 DAPO 的穩定訓練特性,未來有望在更廣泛的領域(如數學推理、程式碼生成與多輪對話)展開深度探索。
對於關注 AI 安全與可解釋性的研究者而言,公開的演算法細節與訓練紀錄提供了寶貴的審查素材;而對於希望快速部署高效 LLM 的工程團隊,則可直接套用提供的部署範例,縮短從模型訓練到線上服務的時間。
結語:隨著 DAPO 的成功示範,開源社群正逐步形成一條從資料、演算法到基礎建設的完整供應鏈。未來若能持續結合更多領域專家與開放平台,將有助於推動大型語言模型的可持續發展,讓技術紅利更廣泛惠及社會各界。
分享