How Much Memory Does Your Agent Actually Need?
核心結論:記憶劑量要依模型能力校準
在 ALTK‑Evolve 的實驗中,我們發現「代理記憶」不是開關式功能,而是一種需要依模型能力調整的劑量。不同規模與特性的模型,對自我蒸餾的指導原則(guideline)的需求截然不同,過多或過少都會影響效能與成本。
背景與實驗設計
ALTK‑Evolve 允許代理在推論時 不更新權重、也不需要人工標註,直接把過去執行軌跡中萃取出的可重用指導原則注入上下文。實驗涵蓋八種模型,從 30 B 的密集模型到最前沿的專有系統,重點比較了三種記憶配置:
| 配置 | 內容 | 代表模型 | |------|------|----------| | 完整指導集 | 把全部自我挖掘的原則一次注入 | DeepSeek‑V3.2 (671 B MoE) | | 緊湊核心 + 任務檢索 | 只保留高信心核心,再根據任務即時檢索少量相關原則 | gpt‑oss‑120b (117 B MoE) | | 無記憶 | 直接使用原始模型,不注入任何指導 | GLM‑5 (745 B MoE) |
MoE(Mixture‑of‑Experts)指模型內部使用多專家結構,能在同等參數下提升效能。
三大模式的觀察
-
強大模型需要完整指導集
-
具備「頭部空間」的模型(即仍有提升空間)能吸收全部原則,包括罕見的邊緣案例。
-
DeepSeek‑V3.2 在加入完整自我蒸餾指導後,任務完成率提升 9.5 個百分點。
-
-
較小或較弱模型適合緊湊核心 + 任務檢索
-
大量指導會使模型「淹沒」,反而降低效能。
-
gpt‑oss‑120b 以 核心+檢索 方式提升 16.1 個百分點,而使用完整指導集僅略增且代價約增加 50% 的 token 數。
-
透過 prompt caching(提示快取),即使在生產環境中使用完整指導集,也能維持成本可接受。
-
-
飽和模型無顯著提升
-
當模型已接近其在測試任務上的上限時,額外記憶不會產生可測量的效益。
-
GLM‑5 在本次測試中屬於此類,未見明顯提升。可能的原因包括:任務已達天花板、指導未涵蓋剩餘失誤、或模型未能有效應用指導。
-
未來展望與讀者啟示
- 記憶校準:開發者在部署代理系統時,應先評估模型的「頭部空間」與任務特性,再決定是使用完整指導集、緊湊核心或不使用記憶。
- 成本效益:透過選擇性檢索與 prompt caching,可在提升準確度的同時,將 token 成本控制在 +5% 左右,實現「最貴不一定最好」的最佳化。
- 持續測試:模型的能力譜會隨新架構與訓練資料變化,建議定期重新測試記憶劑量,以避免因模型飽和而浪費資源。
總結來說,代理記憶的劑量必須與模型能力匹配,才能在提升任務表現的同時,保持成本效益。未來的研究可進一步探討如何自動化劑量校準,讓不同規模的模型都能以最適化的方式利用自我蒸餾的知識。