預計閱讀 1 分鐘原文來源
循環迴路變換器(RLT)概覽
循環迴路變換器(Recurrent Looped Transformer, RLT) 透過將因果編碼器(causal encoder)與循環解碼器(recurrent decoder)結合,實現 無限時間深度的潛在推理。每產生一個 token,解碼器的最終隱藏狀態與層級滑動視窗注意力(SWA)快取會被攜帶至下一個 token,形成一條可延伸的時間路徑。
背景與技術核心
-
全局鍵值記憶與持續計算
-
編碼器負責建構全局 鍵‑值(key‑value)記憶,提供全序列的上下文。
-
解碼器在序列增長時持續延伸 潛在計算,每個 token 會穿過
t × L_D個解碼區塊(L_D為解碼層數),但每個 token 的區塊數保持固定,確保計算成本不隨序列長度線性上升。
-
-
模型‑硬體與模型‑強化學習(RL)共同設計
-
透過 平行編碼、序列批次、記憶重用與檢查點(checkpoint),將重複核心的計算壓縮在硬體上。
-
預訓練、指令微調(SFT)、抽樣與當前策略回放共享同一完整狀態轉移,使得 RL 伸縮性 具備統一的基礎。
-
-
SWA 快取機制
- 每層解碼器保留最近
W個鍵值,其中W‑1為歷史條目,最新 token 亦納入快取。這樣的 滑動視窗 能在不重算全部注意力的前提下,提供最新上下文資訊。
- 每層解碼器保留最近
具體配置與運算特性
- 48 層編碼器 + 48 層解碼器,注意力與前饋網路(FFN)權重在不同階段共享。
- 在產生第
t個 token 後,時間路徑已穿過48t個解碼區塊;每個 token 實際執行 96 個邏輯區塊(編碼與解碼各 48),但跨注意力區塊的 FLOPs(浮點運算次數)不盡相同。 - 已知 token 可批次因果編碼,解碼器仍必須依序更新,以保證 完整的梯度回傳(BPTT) 包含循環輸出、解碼 KV 與編碼記憶。
目前挑戰與未來展望
- 無限深度 指的是可延伸的時間路徑,而非單一 token 內的無限運算;實際的推理效益、硬體效能與 RL 擴展仍待驗證。
- 參數更新會使舊有快取失效,必須重新建構 完整歷史(包括 prompt 狀態與解碼 SWA KV),並確保行為對數機率(log‑probability)與真實抽樣分布相符。
- 未來的研究方向包括:提升快取重用率、優化跨注意力的 FLOPs 分配、以及在 離線策略評估 中保持結構一致性,從而讓 RLT 成為具備長程推理與高效硬體利用的下一代大型語言模型基礎架構。
分享
