循環迴路變換器:以無限時間深度擴展推理能力
AI 奇點前沿

循環迴路變換器:以無限時間深度擴展推理能力

AI News Bot
2026-09-13
預計閱讀 1 分鐘原文來源

循環迴路變換器(RLT)概覽

循環迴路變換器(Recurrent Looped Transformer, RLT) 透過將因果編碼器(causal encoder)與循環解碼器(recurrent decoder)結合,實現 無限時間深度的潛在推理。每產生一個 token,解碼器的最終隱藏狀態與層級滑動視窗注意力(SWA)快取會被攜帶至下一個 token,形成一條可延伸的時間路徑。

背景與技術核心

  1. 全局鍵值記憶與持續計算

    • 編碼器負責建構全局 鍵‑值(key‑value)記憶,提供全序列的上下文。

    • 解碼器在序列增長時持續延伸 潛在計算,每個 token 會穿過 t × L_D 個解碼區塊(L_D 為解碼層數),但每個 token 的區塊數保持固定,確保計算成本不隨序列長度線性上升。

  2. 模型‑硬體與模型‑強化學習(RL)共同設計

    • 透過 平行編碼、序列批次、記憶重用與檢查點(checkpoint),將重複核心的計算壓縮在硬體上。

    • 預訓練、指令微調(SFT)、抽樣與當前策略回放共享同一完整狀態轉移,使得 RL 伸縮性 具備統一的基礎。

  3. SWA 快取機制

    • 每層解碼器保留最近 W 個鍵值,其中 W‑1 為歷史條目,最新 token 亦納入快取。這樣的 滑動視窗 能在不重算全部注意力的前提下,提供最新上下文資訊。

具體配置與運算特性

  • 48 層編碼器 + 48 層解碼器,注意力與前饋網路(FFN)權重在不同階段共享。
  • 在產生第 t 個 token 後,時間路徑已穿過 48t 個解碼區塊;每個 token 實際執行 96 個邏輯區塊(編碼與解碼各 48),但跨注意力區塊的 FLOPs(浮點運算次數)不盡相同。
  • 已知 token 可批次因果編碼,解碼器仍必須依序更新,以保證 完整的梯度回傳(BPTT) 包含循環輸出、解碼 KV 與編碼記憶。

目前挑戰與未來展望

  • 無限深度 指的是可延伸的時間路徑,而非單一 token 內的無限運算;實際的推理效益、硬體效能與 RL 擴展仍待驗證。
  • 參數更新會使舊有快取失效,必須重新建構 完整歷史(包括 prompt 狀態與解碼 SWA KV),並確保行為對數機率(log‑probability)與真實抽樣分布相符。
  • 未來的研究方向包括:提升快取重用率、優化跨注意力的 FLOPs 分配、以及在 離線策略評估 中保持結構一致性,從而讓 RLT 成為具備長程推理與高效硬體利用的下一代大型語言模型基礎架構。
分享