為何剪除 LLM 區塊是多體問題
在大型語言模型(LLM)中,削減 transformer 區塊(亦稱深度剪枝)是提升推論速度與降低記憶體需求的最直接手段。模型變短後,推論時間可預測縮短,且此方法能與量化、低秩壓縮等技術無縫結合。然而,真正的挑戰在於「哪一些區塊可以被刪除」——刪錯區塊會導致模型性能崩潰,且每個區塊的影響往往取決於同時被刪除的其他區塊,選擇之間存在交互作用,這使得問題從單純排序變成組合優化。
背景:從單一評分到多體互動
傳統的區塊刪除方法多採用 單塊評分:根據權重大小(magnitude)、敏感度(sensitivity)或「區塊影響」等啟發式指標,挑選看似不重要的區塊逐一移除。從物理學角度看,這相當於**平均場(mean‑field)**近似——把每個區塊視為與其他區塊獨立,類似把自旋的鄰居以單一平均場代替。另一種常見的簡化是只允許刪除連續的一段區塊,以減少搜尋空間,但同樣犧牲了大量可能的組合。
隨著模型層數加深、結構日益異質,**區塊之間的耦合(coupling)**變得不可忽視。舉例來說,刪除第 20 層的影響會因是否同時刪除第 19 或第 24 層而大相逕庭,這正是多體系統的典型特徵。若忽略這些耦合,在深度壓縮(一次刪除大量區塊)時會大量損失模型品質。
研究突破:將區塊選擇映射為受限二元優化
Multiverse Computing 最近發表的《LLM Compression by Block Removal with Constrained Binary Optimization》將上述組合問題具體化為 受限二元優化(CBO),進一步映射到 Ising 玻璃(一種具有全連接相互作用且固定「向上」自旋數量的無序自旋系統)。在此模型中:
- 每個區塊對應一個二元變數(保留=0、刪除=1)。
- 所有變數之間的相互作用即為區塊間的耦合效應。
- 系統的總能量(energy)被證明是模型在基準測試上的表現的低成本代理指標。
利用這個能量函數,我們可以在不實際跑測試的情況下,快速評估海量區塊組合的優劣,然後將最具挑戰性的實例交給經典或量子啟發式求解器(如模擬退火、量子近似優化演算法)進行精細搜尋。實驗顯示,在 Llama‑3.3‑70B‑Instruct 進行 50% 壓縮 時,該方法在 MMLU(多任務語言理解)基準上提升近 23 個百分點,遠超目前最好的區塊刪除方案。
為何此方法具備廣泛延伸性
雖然研究聚焦於稠密 transformer,但 CBO 與 Ising 模型的抽象化並不依賴於特定架構。任何具備層級或模組化設計的神經網路,都可以將「是否保留」的決策轉化為二元變數,從而套用相同的能量最小化框架。這為未來在 視覺 transformer、圖神經網路 等領域的模型壓縮提供了理論基礎。
未來展望與讀者啟示
-
跨領域求解器的整合:隨著量子硬體與量子啟發式演算法的成熟,將可望在更大規模的 CBO 問題上取得突破,實現更高比例的模型壓縮而不犧牲效能。
-
自動化壓縮流水線:結合量化、低秩分解與區塊刪除的多重手段,未來可望形成“一鍵壓縮”服務,讓開發者專注於應用層面的創新。
-
可解釋性研究:透過能量函數的物理解讀,我們或能更深入了解哪些區塊在語意表徵上扮演關鍵角色,為模型可解釋性提供新視角。
總結來說,將 LLM 區塊剪除 視為多體問題,不僅揭示了傳統啟發式方法的局限,也提供了一條結合物理模型與先進演算法的全新路徑。對於希望在效能與資源之間取得最佳平衡的企業與研究團隊而言,這是一個值得關注且具備實際商業價值的發展方向。
