NVIDIA Dynamo 搭配 EPD 解耦技術,顯著提升多模態推論效能
核心結論:透過 Encode‑Prefill‑Decode (EPD) 解耦,將視覺編碼階段與 LLM 的 prefill、decode 階段分離,NVIDIA 開源推論框架 Dynamo 能在圖像密集的請求下實現 最高 5 倍 的首 token 延遲(TTFT)縮短,以及 7 倍 的端到端回應時間加速。此效能提升僅在「影像占比高、輸出長度為短至中、且使用量化 MoE(Mixture‑of‑Experts)模型」的情境最為顯著。
背景與技術原理
多模態請求在 LLM(大型語言模型)開始 prefill 前,必須先完成 視覺轉換器 (ViT) 的影像編碼,產生 嵌入向量。在傳統的 聚合式服務 中,視覺編碼、LLM prefill 與 decode 皆共享同一個 GPU 工作節點與排程域,設計簡潔,但當請求中包含大量圖片或影片時,視覺編碼往往耗時數百毫秒,會直接阻塞同一 GPU 上的文字預填與解碼工作,導致 資源競爭 與 延遲累積。
Dynamo 的 EPD 解耦則把 Encoder Worker(負責 Vision Encoder)與 PD Worker(負責 Prefill & Decode)拆開,兩者可以在 不同 GPU、甚至不同硬體層級上獨立擴展。Encoder 產生的嵌入向量透過 NVIDIA Inference Transfer Library (NIXL) 直接傳遞給 PD Worker,實現批次化、排程與擴展的獨立最佳化。
何時適合採用 EPD 解耦
| 條件 | 受惠程度 | |------|----------| | 影像/影片比例高(單次請求含多張圖片) | 大幅降低 TTFT,提升同 SLO(服務等級目標)下的 goodput | | 輸出長度為短至中(數十 token) | 減少編碼與解碼之間的同步成本 | | 使用量化 MoE 模型 | 量化減少記憶體占用,配合解耦可更彈性配置 GPU |
若 編碼工作量不足 以抵消協調與嵌入傳輸開銷,或是請求主要為純文字,則 不建議 使用 EPD,因為額外的 Worker 會增加系統複雜度且可能降低整體吞吐。
硬體配置選項
-
共置 (Colocated):Encoder 與 PD Worker 共享同一 GPU 群組,但以不同容器執行。適用於 GPU 數量有限、但仍希望利用批次化效益的情境。
-
分離 (Disaggregated):Encoder 完全跑在獨立的 GPU 層級(如低階 GPU),PD Worker 則使用高效能 GPU。此配置在 影像處理負載重 時可避免視覺編碼阻塞文字推論,達到最佳延遲與吞吐平衡。
硬體可用性決定 Encoder 能否部署於較低成本的 GPU;工作負載特性則決定分離是否能帶來實質效益。
未來展望與讀者啟示
EPD 解耦展示了 服務化 AI 推論 從「單一排程」向「模組化、彈性擴展」的轉變。隨著多模態應用(如影像問答、視訊摘要)需求持續增長,開發者應評估自身工作負載的影像占比與模型結構,適時導入 Dynamo 的 EPD 方案,以獲得 更低的首 token 延遲 與 更高的端到端效能。同時,硬體規劃上也應考慮 多層級 GPU 的佈局,讓視覺編碼與文字推論能在最適合的資源上同時運行,最大化成本效益。
結語:在圖像密集的 AI 服務場景,NVIDIA Dynamo 搭配 EPD 解耦已成為提升推論速度的關鍵利器。掌握正確的部署時機與硬體配置,將是未來多模態應用競爭力的關鍵因素。
