NVIDIA Topograph:為 AI 工廠的 GPU 工作負載配置注入拓撲感知
在電力受限的 AI 工廠裡,GPU 工作負載的配置是決定效能與成本的關鍵。若工作負載被錯置,會把同一拓撲域(locality domain)切割成碎片,迫使資料必須跨越共享連結,導致吞吐量下降、工作成本上升,甚至讓 GPU 在等待資料時仍消耗配額電力,效率大打折扣。
背景與技術基礎
GPU 在訓練與推論過程中會持續交換資料,分散式工作負載因而高度依賴通訊局部性(communication locality)。
- NVLink 與 NVLink Switch:提供機架內 GPU 之間的高頻寬全互連(all‑to‑all)連接,讓每顆 GPU 都擁有專屬通道,避免在負載高時共用頻寬。第五代(Blackwell,例:GB200/GB300)單卡雙向頻寬可達 1.8 TB/s,第六代(Vera Rubin)更提升至 3.6 TB/s。
- Spectrum‑X Ethernet:在系統與機架之間提供可預測、低延遲的擴展網路,適用於跨機架的規模化部署。
- Quantum InfiniBand:最高可達 800 Gb/s,支援大規模叢集的高速資料傳輸。
若排程器能即時掌握這些 GPU 與網路的相互關係,就能將緊耦合的工作負載安排在同一拓撲域內,減少跨域流量,降低競爭與延遲。
Topograph 的角色與運作
NVIDIA Topograph 以開源工具箱形式出現,負責自動發掘叢集拓撲並將結果正規化為排程系統可直接使用的模型。其核心流程如下:
-
拓撲偵測:透過雲端 API 或本地 Fabric 系統取得硬體連接資訊。
-
模型正規化:將多樣的硬體描述轉換成統一的拓撲模型。
-
資訊發布:依需求輸出 Kubernetes 節點標籤(node labels)、Slurm 拓撲配置檔或 Slinky ConfigMap,供各工作負載管理器使用。
在 NVIDIA DSX OS 叢集編排層中,Topograph 與 Dynamic Resource Allocation(DRA)、KAI Scheduler 並行工作,實現拓撲感知的 gang scheduling(同時排定多個相依工作),確保 AI 工廠的資源配置始終與實際硬體連接保持同步。
為何拓撲感知排程不可或缺
- 即時性:Topograph 會在叢集變更(如 GPU 增減、網路重構)時自動重新生成拓撲視圖,排程器不再依賴手動維護的快照。
- 效能提升:將高度耦合的工作負載放在同一域內,可減少跨域流量,降低網路爭用與延遲。
- 成本控制:避免 GPU 在等待資料時閒置,提升每瓦特的算力產出,降低整體運營支出。
未來展望與讀者啟示
隨著 AI 模型規模持續膨脹,拓撲感知的資源配置將成為叢集效能的基本門檻。Topograph 已示範出一套可擴展、即時且開源的解決方案,未來可能結合更多雲端服務供應商的 API,或支援更細粒度的硬體指標(如溫度、功耗)進一步優化排程決策。
對於建置或管理 AI 工廠的企業而言,導入 Topograph 不僅能即時捕捉硬體變化,還能在 Kubernetes、Slurm、Slinky 等主流工作負載管理平台上實現拓撲感知排程,從而在電力與成本受限的環境中,最大化 GPU 的運算效益。
