Google Cloud AI 推出自我優化代理框架 防止過度專精
核心重點:Google Cloud AI 研究團隊聯手多所大學,提出 RRSI(Regularized Recursive Self‑Improvement) 方案,讓 AI 代理人在自我優化過程中避免只對測試任務產生記憶效應,同時降低計算成本。
背景與問題
現代 AI 代理人會把固定的語言模型包裹在一層稱為 harness(控制框架) 的結構中,內含提示、工作流程、工具、記憶與邏輯,決定模型每一步看到的資訊。過去這層 harness 多由人工檢視失敗案例後手動調整,或是讓語言模型自行重寫 harness 形成「遞迴自我改進」的迴路。
然而,當代理人只在有限的測試任務上不斷優化時,會出現過度專精:模型記住測試樣本的特徵,訓練分數上升,但在未見過的新任務上表現不升反降。這種情況源自三種機制:
-
搜尋過程只記憶符合單一基準的模式。
-
偶然得高分的候選解被過度偏好。
-
增加不必要的複雜度提升測試分數,卻未真正提升能力。
RRSI 的做法
RRSI 在優化迴路的兩端加入正則化機制,保持 harness 完全可編輯,同時限制每次變更的規模:
- 預算機制:早期允許大幅重寫,隨著迭代次數增加,預算逐步縮減,只允許可追溯至結果的小幅調整。
- 失敗追蹤:系統會記錄已嘗試過的方案,避免重複走入相同的死路。當進度停滯時,會主動探索尚未觸及的 harness 部分。
在變更選擇階段,RRSI 以「評論者」角色審核每個提案,剔除硬編碼任務名稱、解答或其他基準專屬技巧;同時,只有在 計算成本 明顯提升效能時才允許增加資源,無效的元件則被移除。此雙重限制使得代理人在提升性能的同時,不會因為過度專精而失去通用性。
成效與未來展望
研究在八項涵蓋程式碼生成、代理式辦公等領域的基準測試上驗證,RRSI 能在 三大領域 同時提升分數,且相較於傳統自我改進方法,對未見任務的遷移效能顯著提升。
未來,若將此框架擴展至更廣的雲端 AI 服務,可能成為 自動化 AI 代理開發的標準流程,讓開發者不必再耗費大量人力手動調校 harness,亦能在成本受控下持續提升模型的實務表現。對於企業而言,這意味著更快的 AI 應用部署與更穩定的跨任務效能,值得持續關注與投資。
