英偉達 DOCA GPUNetIO 讓 GPU 主導網路運算
綜合科技

英偉達 DOCA GPUNetIO 讓 GPU 主導網路運算

AI News Bot
2026-10-08
Photo by Nana Dua on Pexels
預計閱讀 1 分鐘原文來源

NVIDIA DOCA GPUNetIO:讓 GPU 主導網路運算的關鍵里程碑

在傳統架構中,CPU 必須介入每一次的網路傳輸,成為不可避免的瓶頸,增加延遲、限制分散式應用即時回應的效能。隨著深度學習、即時影像與高頻交易等工作負載愈趨依賴大量資料移動,GPU 需要直接掌控網路 I/O,才能真正成為「第一級」運算資源。

GPUNetIO 的核心技術

DOCA GPUNetIO 是 NVIDIA 針對 GPU‑centric 網路設計的 SDK 層,結合了三大技術:

  • GPUDirect RDMA:允許 GPU 直接透過遠端直接記憶體存取(RDMA)與外部裝置交換資料,省去 CPU 介面。
  • GPUDirect Async Kernel‑Initiated (GDA‑KI):CUDA 核心可自行發起網路或 DMA(直接記憶體存取)作業,保持 CPU 完全脫離關鍵路徑。
  • GDRCopy:提供高效能的資料搬移緩衝,減少複製開銷。

透過這些機制,CUDA 核心能直接驅動 Ethernet、RDMA、Verbs 以及 DMA,實現「GPU 主導」的即時封包處理與資料流動。

從零碎實作到統一平台

GPUNetIO 推出前,各大通信函式庫(如 NCCL、NVSHMEM、UCX/NIXL 等)各自開發 GDA‑KI‑style 的實作,導致程式碼重複、維護成本高、功能碎片化。GPUNetIO 把這些實作統一於同一套 GDA‑KI 基礎,帶來三大好處:

  1. 共享投資:功能、最佳化與錯誤修正只需在一處完成,即可惠及所有上層庫。

  2. 降低工程重複:開發者不必為每個庫重新實作 GPU‑initiated RDMA,縮短開發週期。

  3. 加速創新傳遞:任何針對 GPUNetIO 的改進,都能快速在 NCCL、NVSHMEM、Aerial 5G SDK、Holoscan 等生態系統中被採用。

這種統一策略對 NIXL/UCX、NCCL、NVSHMEM 等高階通信框架尤為重要,因為它們可直接利用 GPUNetIO 的成熟堆疊,減少行為差異,提升長期演進的穩定性。

產品形態與未來展望

NVIDIA 以兩種緊密相關的形式提供 GPUNetIO:

  • 完整 DOCA SDK 版:作為 DOCA 程式設計指南中的完整實作,涵蓋更廣的 DOCA 生態(包括 NVQLink、Holoscan 進階網路運算子等)。
  • 開源函式庫:讓社群能自行檢視、擴充與貢獻,促進跨廠商合作。

未來,隨著 5G、邊緣運算與大型語言模型持續推升資料流量,GPU 直接掌控網路的需求將更為迫切。GPUNetIO 的統一基礎不僅為當前高效能計算提供關鍵加速,也為新興應用奠定「GPU 為中心」的網路架構藍圖。對於開發者而言,掌握 GPUNetIO 即是把握下一波效能突破的關鍵。

分享