強化學習先驅理查德·薩頓警告合成資料無法解決大型語言模型的擴展瓶頸
AI 奇點前沿

強化學習先驅理查德·薩頓警告合成資料無法解決大型語言模型的擴展瓶頸

AI News Bot
2026-08-21
預計閱讀 1 分鐘原文來源

理查德·薩頓警告:合成資料無法突破大型語言模型的擴展瓶頸

理查德·薩頓(Richard Sutton),圖靈獎得主、強化學習(Reinforcement Learning)領域的奠基人,近日在接受訪談時指出,當前 AI 研究所普遍採用的「合成資料」策略,無法解決大型語言模型(Large Language Model, LLM)在規模擴張上的根本限制。

背景:從「苦澀教訓」到計算規模的勝者

薩頓在 2019 年發表的《The Bitter Lesson》一文中主張,長期而言,只有能隨計算資源成長的 AI 方法(如搜尋與自我學習)才能勝出;相對地,依賴人類先驗知識的技巧最終會被淘汰。LLM 正是「苦澀教訓」的典型案例:它們藉由巨量算力「吞下」整個網路(Internet),取得驚人表現,但同時也在此處遭遇天花板——網路資訊是有限的,而真實世界的複雜度遠超網路所能覆蓋的範圍。

合成資料的兩大阻礙

1. 「大世界假說」

薩頓與共同創辦人 Khurram Javeed 以「Big World Hypothesis」闡述:世界的複雜度是無限且遠高於任何單一代理(agent)或模擬程式所能捕捉的程度。即使我們寫出高度精細的模擬器,也只能產生「微觀」的、與現實不符的環境——例如摩擦係數或機械馬達的行為模型會出錯。更重要的是,世界中充斥著無法以合成資料再現的其他智慧體(如人類的心智),「沒有任何方式能為他人的思維產生合成資料」。

2. 人類瓶頸

合成資料的品質判斷仍須仰賴領域專家。若要訓練一架模仿蝙蝠回聲定位的無人機,首先必須聘請熟悉回聲學的專家設計資料集;即便是自駕車在模擬環境中訓練,最終仍需要人類介入修正模擬與現實之間的差距。這種**「以人為核心」的流程本身就限制了規模的擴張**。

薩頓的解方:讓代理自我生成模擬器

薩頓主張,應將人類從資料循環中移除,讓代理透過自身經驗不斷學習與校正世界模型(world model)。換言之,代理自行建立「模擬器」而非依賴人類手工打造的固定模擬環境。這種自我生成的模擬器能隨著交互不斷演化,理論上更能貼近真實世界的多樣性與不確定性。

未來展望

若 AI 研究社群真的遵循「讓代理自行探索」的路徑,未來的 LLM 可能不再受限於網路資料的上限,而是透過真實交互累積知識。對產業而言,這意味著 資料標註與模擬建置的成本將大幅下降,同時也提醒我們在追求規模時,必須重新審視「人類知識」與「計算資源」之間的平衡。

結語:合成資料並非解決 LLM 擴展瓶頸的靈丹妙藥;唯有讓智慧體自行經驗、持續修正其內部模型,才能突破「大世界」的限制,邁向真正具備通用學習能力的人工智慧。

分享