谷歌推出 WikiSkill:為 AI 代理打造持續性知識庫
谷歌研究團隊近日發表 WikiSkill 框架,首次將 AI 代理(agent)與永續的知識庫結合。傳統上,代理在每次執行任務後所學的經驗會被遺棄,無法累積。WikiSkill 則把失敗與成功的案例以類似維基(wiki)的結構保存,並轉化為 Agent Skills——可重複使用的模組,讓代理在未來的執行中自行參考、改寫指令。
三層結構的知識管理
-
Raw Layer(原始層)
- 記錄完整的執行痕跡,包括工具呼叫、返回結果等,資料不可變更,作為原始素材。
-
Wiki Layer(維基層)
- 從原始層提煉出結構化的洞見,例如失敗模式與成功策略。此層不會被重置,隨每次迭代持續增長。
-
Skill Layer(技能層)
- 保存代理在執行任務時實際遵循的程序指令。若新指令導致效能下降,可回滾至先前版本;但維基層的知識仍保留,供未來參考。
執行流程為:代理使用當前技能完成任務 → Wiki Maintainer 分析痕跡、寫入維基 → Skill Proposer 依據維基與新痕跡提出技能調整 → 門檻機制在驗證集上測試,若未提升效能則回滾技能,維基仍保留失敗記錄。
實驗結果與效能提升
研究者在五大基準測試(數學推理、網頁搜尋、試算表操作、文件問答、虛擬環境互動)上驗證 WikiSkill。使用的模型包括 Qwen(4B、9B、27B 版)、Gemma‑4‑31B 與 Gemini‑3.5‑Flash。結果顯示,WikiSkill 持續領先 以往的技能演化方法:
- Gemini‑3.5‑Flash 的整體表現由 49.5 % 提升至 68.1 %。
- Qwen‑3.6‑27B 從 39.4 % 提升至 63.3 %。
在單項基準上,提升幅度更為顯著,例如 Gemini‑3.5‑Flash 在 LiveMath 測試中從 33.0 % 飆升至 72.6 %。
背後的理念與未來展望
WikiSkill 的概念受到 Andrej Karpathy 「LLM Wiki」的啟發,主張將 AI 的經驗彙編成永續、可累積的知識。雖然代理本身仍未具備真正的持續學習能力(continuous learning),但透過自動化的知識寫入與技能更新,已展現出 實用的替代方案。未來若能結合更精細的錯誤分析與跨模型共享的維基,或許能縮小「持續學習」與「一次性訓練」之間的鴻溝。
對於產業與開發者而言,WikiSkill 提供了一條 可追溯、可回溯 的改進路徑,讓 AI 系統在部署後仍能透過累積的實務經驗逐步優化,降低重新訓練的成本與風險。隨著更多模型加入此框架,期待看到更廣泛的應用場景——從客服機器人到自動化資料分析,都能受惠於這座「永恆的維基」所帶來的知識沉澱。