谷歌與深度思維推出 Dream‑RSI 提升 AI 代理搜尋效率
核心重點
谷歌(Google)與深度思維(DeepMind)聯手研發的 Dream‑RSI,是一套讓自我改進 AI 代理在執行複雜搜尋任務時,能以「回顧」方式測試新策略、減少重複計算的技術。它不改變產生答案的模型本體,只優化搜尋過程本身,從而大幅降低探索(exploration)階段的算力開銷。
背景與技術原理
自我改進的 AI 代理會不斷 提出解答 → 評估結果 → 從中學習 → 再次嘗試,在千百次迭代後逐步逼近最佳解。對於搜尋空間龐大的問題(如自動程式生成、數學證明),代理必須在眾多可能的路徑中挑選值得深入的方向,這個挑選過程即是 探索。傳統的探索方式有兩大缺點:
-
固定搜尋策略:無法從過往經驗學習,容易重蹈覆轍。
-
即時調整策略:雖能學習,但每次測試新策略都需要重新執行完整的長時間搜尋,成本極高。
Dream‑RSI 的創新在於 「重播」 已完成的搜尋紀錄。代理在實際搜尋時會將每一步的決策與結果完整記錄下來,形成一棵「搜尋樹」。之後,系統可以在不重新執行計算的情況下,將不同的策略套用於這棵已建立的樹上,模擬如果當初選擇其他分支或提前放棄某條路徑,結果會是如何。這個過程被稱為 「夢想」(dreaming),因為代理在「腦中」演練成千上萬種變化,挑選出最有前景的策略,再於下一輪真實搜尋中實施。
因為所有需要的解答與評分已經存在於先前的紀錄中,Dream‑RSI 免除了重新產生或評估解答的昂貴運算,讓策略測試的成本下降至幾乎可以忽略的程度。
影響與未來展望
Dream‑RSI 的循環式流程——搜尋 → 記錄 → 夢想測試 → 改良策略 → 再次搜尋——證明了即使在不改變基礎模型的前提下,也能顯著提升 AI 代理的效率。對於需要大量探索的領域,如自動程式優化、化學分子設計或大型數學證明,這項技術有望縮短開發週期、降低雲端算力支出。
未來,若將 Dream‑RSI 與更強大的大型語言模型(LLM)結合,或許可以讓代理在「夢想」階段不僅測試決策,更能即時生成新穎的子問題或提示,進一步推動 自我發現新演算法 的可能性。對產業與學術界而言,關鍵在於如何建立高品質、可重用的搜尋紀錄庫,讓每一次的「夢」都能為下一次的實際搜尋帶來實質突破。
讀者啟示:在 AI 研發流程中,資料的可追溯與重用同樣重要。Dream‑RSI 提醒我們,透過系統化的「回顧」與「模擬」,不必每次都從零開始,即可持續提升搜尋效能,為未來的 AI 代理奠定更高效、永續的發展基礎。