英偉達 Dynamo 推出 影子引擎復原 大幅縮短 LLM 冷啟動時間
在大型語言模型(LLM)服務中,當推論引擎因程式錯誤或 CUDA 錯誤而失效,傳統的復原方式是 冷啟動:必須從儲存裝置把權重載入 HBM(高頻寬記憶體),重新編譯 kernel,並重新捕獲 NVIDIA CUDA 圖形。對於數十億參數的模型,這個過程常需數分鐘,期間其他工作者必須承接全部流量,導致 TTFT(首次回應時間)升高、每位使用者的解碼速率下降。
影子引擎復原的運作機制
Dynamo 的 影子引擎復原(預覽功能)將上述大部分工作搬離服務路徑。核心概念有三:
-
持續的 GPU 記憶體服務(GPU Memory Service,GMS)
GMS 以 sidecar 形式存在於每顆 GPU,負責管理權重等大型記憶體區段。它不持有 CUDA context,只分配實體頁面,提供「handle」給不同的推論引擎。引擎在啟動時一次性映射這些頁面,之後的存取完全不再依賴 GMS。
-
預熱的影子引擎
在同一組 GPU 上,同步保留一個已完成權重載入、已編譯好 kernel 的待命引擎。該引擎的權重透過 GMS 與主引擎共享,並未在 HBM 中產生第二份拷貝。
-
工作者層面的協調
若主引擎發生故障,影子引擎在數秒內接管服務,新的主引擎則在背景中完成剩餘的初始化工作,完全不影響前端流量。
實測成效
測試環境為兩個工作者共同提供 GLM-5.2 模型服務。未啟用影子引擎復原 時,當其中一個工作者被強制終止,剩餘工作者必須在 283 秒 的冷啟動期間承擔全部請求,TTFT 明顯惡化,解碼速率下降。啟用影子引擎復原 後,備援工作者在 7.3 秒 內恢復服務,速度提升近 39 倍,服務中斷時間大幅縮減,使用者體驗幾乎不受影響。
未來展望
影子引擎復原解決了兩大瓶頸:權重生命週期與引擎流程的耦合 以及 失敗前無法完成的初始化。隨著 LLM 規模持續擴大,冷啟動的時間成本將成為營運的關鍵風險。若英偉達持續將 GMS 與 Dynamo 整合,未來有望在多租戶雲端環境中實現即時容錯,讓大型模型的部署更具彈性與可靠性。
對於使用者而言,這代表在雲端 AI 服務中,突發的程式崩潰不再導致長時間的服務停擺;對業者而言,則可減少因故障導致的資源浪費與營運損失,進一步提升 AI 應用的商業價值。
