量化感知修復:恢復壓縮 4 位元 LLM 的效能
AI 奇點前沿

量化感知修復:恢復壓縮 4 位元 LLM 的效能

AI News Bot
2026-08-26
Photo by Egor Komarov on Pexels
預計閱讀 1 分鐘原文來源

核心重點

Quantization‑Aware Healing (QAH) 讓壓縮至 4 位元的巨型語言模型(LLM)不僅恢復,甚至超越原本的 16 位元(bfloat16)表現。以 GPT‑OSS 120B 壓縮至 60B、再量化為 MXFP4 為例,該 4‑bit 模型在 9 個基準測試中有 7 項領先。

背景與挑戰

在實務部署中,將大型模型縮小的慣用流程為三步:

  1. 結構壓縮——刪除層、頭或神經元,以減少參數量。

  2. 位元量化——將剩餘權重壓縮至 4 位元,以降低記憶體與運算需求。

  3. 修復(healing)——彌補前兩步造成的效能損失。

傳統的修復方法以 量化感知訓練 (QAT) 為主,透過在前向傳播中插入偽量化算子,並以任務損失微調模型。此舉等同重新執行一次昂貴的多階段後訓練流程(監督微調、RLHF、代理調整等),成本高且訓練過久易出現不穩定。

另一種 量化感知蒸餾 (QAD) 則直接以全精度教師模型的 logits 透過 KL 散度蒸餾至量化學生模型,適用於僅有位元量化的情況。當模型已經經歷結構壓縮(層數、頭數、神經元皆減少)時,缺乏對應的全精度教師,QAD 的假設即告失效。

QAH 的創新

QAH 針對「結構壓縮 + 位元量化」的雙重衝擊,提出 量化感知修復 的新流程:在量化後直接以 任務導向的微調 結合 知識蒸餾,讓模型同時學習低位元表示的容錯能力與結構變化的適應性。此方式避免了長時間的 QAT 訓練,同時克服了 QAD 無教師可用的限制。

實驗結果與意義

  • 模型規模:GPT‑OSS 120B → 壓縮至 60B → 量化為 MXFP4(4‑bit)。
  • 效能比較:在 9 項基準測試(推理、數學解題、程式碼生成等)中,4‑bit 模型 7 項優於 原始 bfloat16 全精度模型。
  • 成本效益:模型更小、運算更便宜,且精度更高,顛覆了「4‑bit 必然劣於 16‑bit」的傳統觀念。

未來展望

QAH 為 LLM 部署提供了一條 「壓縮即是提升」 的新路徑,未來可望在以下方向深化:

  • 將 QAH 套用於更廣泛的模型族群(如 NVIDIA Nemotron、Hypernova 系列),驗證其通用性。
  • 探索自動化的 壓縮‑量化‑修復 流水線,降低工程師手動調校的門檻。
  • 結合硬體加速器的 4‑bit 原生支援,進一步縮減推論延遲與能源消耗。

對於希望在雲端或邊緣設備上部署大型語言模型的企業與研究團隊而言,Quantization‑Aware Healing 已成為提升效能、降低成本的關鍵技術。

分享