英偉達機密運算提升 Blackwell GPU 上的安全 LLM 推論
隨著大型語言模型(LLM)在個人、企業與受規範環境中處理越來越多敏感資訊與專有模型上下文,資料必須在受信任的環境內完成運算。英偉達的 Confidential Computing(CC) 透過記憶體加密的機密虛擬機(CVM)、機密 GPU 以及加密的 NVLink(NVIDIA 內部高速互連),提供一條安全執行工作負載的路徑,使得 AI 推論能在受信硬體上上線。
為何需要同時優化框架與硬體
NVIDIA TensorRT LLM 是結合框架層級最佳化與英偉達加速運算的 最佳化 AI 推論解決方案。然而,當此類框架在啟用 CC 的環境中執行時,記憶體搬移、計時、排程與多 GPU 通訊的假設皆需重新調整。若執行階段未針對這些變化做出適配,將產生顯著的效能損耗。因此,推論框架與機密運算平台必須同步優化,才能在保護資料安全的同時維持高效能。
評估方法與實驗結果
英偉達的效能工程團隊採用了以下測試流程:
-
工作負載選擇:挑選具備長輸入上下文、延伸輸出產生且低併發的情境。長上下文會在預填階段加大資料搬移壓力;延伸產生則放大每個 token 的微小 CC 開銷;低併發則避免將成本分散到多個請求上,讓開銷更易觀測。
-
雙重執行:在 CC 關閉(CC off)與 CC 開啟(CC on)兩種狀態下,以相同的模型、硬體、框架版本、序列長度、平行度與併發度執行工作負載,唯一變數即為 CC 狀態。
-
效能指標:以 output‑token throughput(每秒輸出 token 數)與 TPOT(Throughput‑per‑Operation‑Time,單位時間內的吞吐量)作為主要衡量。
測試結果顯示,在 1 至 16 的併發等級下,CC 開啟時仍保留 96.1%~98.2% 的 CC 關閉基線吞吐量,而 TPOT 差距僅介於 1.2%~4.3% 之間,證明即使在嚴格的機密路徑下,效能衰減也相當有限。
未來展望
Blackwell 系列 GPU 所採用的 硬體強制安全路徑,不僅保護資料與工作負載的使用階段,更為 企業級 AI 推論 提供了可落地的安全基礎。隨著更多 AI 平台工程師將機密運算納入產品藍圖,預期未來的 TensorRT LLM 與其他推論框架將持續針對 CC 進行深度優化,縮小安全與效能之間的差距。
對於關注資料隱私與 AI 效能的讀者而言,本文的測試方法提供了一套可量化 CC 開銷的標準流程,企業在導入機密推論前,可依此評估自身工作負載的實際影響,從而在安全與效能之間取得最佳平衡。
