輕量化 GRPO 微調提升 LFM2.5‑350M 結構化輸出準確度
核心結論
透過 Group Relative Policy Optimization(GRPO)搭配 TRL(Transformer Reinforcement Learning)函式庫,對 350M 參數的 LFM2.5 基礎模型進行輕量化微調,只需約 500 筆樣本、100 步訓練,即可將 IFStruct 結構化輸出基準測試分數從 22.6% 提升至 29.7%。此流程可在免費層的 Colab 或 Kaggle GPU 上完成,且完整程式碼已公開於 GitHub。
背景與技術說明
-
結構化輸出:指模型必須依照指定的 JSON Schema 或其他格式,產生可直接解析的資料。此項能力是 LLM 能否嵌入下游系統的關鍵判斷依據,卻常被測試平台混入一般推理或抽取分數,未能單獨量測。
-
IFStruct 基準:由 Liquid AI 開源,提供驗證 LLM 輸出合法性與 schema 符合度的測試集(LiquidAI/ifstruct‑v1.0)。官方報告 LFM2.5‑350M 的分數為 21.1%,本地使用 llama.cpp BF16 GGUF 版本測得 22.6%,作為本次微調的基線。
-
微調流程
-
資料來源:採用 nvidia/Nemotron‑RL‑instruction_following‑structured_outputs,該資料集為每筆提示配對目標 JSON Schema 及預期欄位數,約 500 筆可作為微調樣本。
-
LoRA(Low‑Rank Adaptation):以低秩矩陣方式調整模型權重,降低記憶體需求。
-
Reward Function:根據 schema 符合度給予正向回饋,驅動 GRPO 演算法優化策略。
-
訓練與合併:完成 100 步訓練後,將 LoRA 權重合併回原始模型,並儲存為可直接部署的檔案。
-
影響與未來展望
此案例證明,即使是 350M 級別的輕量模型,只要透過針對性微調,也能在結構化輸出上逼近甚至超越數十億參數的大型模型表現。對於資源受限的開發團隊或想在本地端部署安全、可控 AI 服務的企業而言,這種「低成本高效能」的路線具有以下幾點啟示:
-
民主化 AI:不必依賴昂貴的雲端算力,即可取得可靠的 schema 合規能力。
-
快速迭代:500 筆樣本、數分鐘訓練即可驗證改進,適合敏捷開發流程。
-
可擴展性:相同的 GRPO‑TRL‑LoRA 組合可平移至其他領域(如程式碼生成、表格填寫),提升模型的專業化表現。
未來研究可探討更大規模的資料擴增、不同 reward 設計對 schema 合規性的細微影響,以及在多語言環境下的微調效能。對於關注 結構化輸出 的技術人員而言,這份公開、低門檻的微調指南提供了一條可直接落地的實踐道路。