NVIDIA 推出 Scale‑In:為代理式 AI 工廠打造 DPU 加速網路基礎建設
在傳統雲端資料中心,北向‑南向(north‑south)網路主要服務可預測的通用工作負載,介面與資源配置皆以軟體定義、彈性組合為主。然而,代理式 AI 工廠(agentic AI factories)將大量加速運算、數十億參與者、各式應用與企業資料源緊密結合,對頻寬與即時性提出前所未有的需求。NVIDIA 以 Scale‑In 為第五支 AI 網路支柱,透過專為此類環境設計的 DPU(資料處理單元),在安全、存取與運維層面提供全新加速能力。
背景:從傳統北向‑南向到統一加速域
傳統資料中心的北向‑南向網路是用來把使用者、應用程式、資料庫與儲存系統連接至單一伺服器的「入口」與「出口」。在軟體定義網路(SDN)與彈性資源配置的加持下,這類網路可以隨需求自動伸縮。AI 工廠卻不僅需要這些特性,還必須同時支援:
- 多租戶網路:不同部門或客戶的流量必須相互隔離,避免資料外洩。
- 超高速資料搬移:每台伺服器的加速運算頻寬已達 多太位元/秒(multi‑terabit) 級別,傳統 CPU 處理的網路堆疊已成為瓶頸。
- 即時安全防護:AI 模型與敏感資料在傳輸過程中需要硬體層級的加密與檢測。
為此,NVIDIA 以 BlueField‑4 DPU 為核心,搭配 DOCA(Data‑center‑On‑Chip Architecture) 軟體平台,並透過 Spectrum‑X 乙太網路 介面將硬體加速延伸至整個資料中心的北向‑南向通道。
Scale‑In 的關鍵技術與效益
| 技術 | 說明 | 產生的效益 | |------|------|------------| | BlueField‑4 | 內建多核心 ARM 處理器、智慧網路介面卡與可程式化加速引擎。 | 將網路、儲存與安全功能從主機 CPU 卸載,降低延遲與 CPU 負載。 | | DOCA | 統一的開發框架,讓開發者可在 DPU 上部署自訂的資料流、加密與監控程式。 | 簡化應用程式與基礎設施的整合,提升可觀測性與可管理性。 | | Spectrum‑X | 支援 400 Gb/s 以太網路的高頻寬介面。 | 滿足 AI 工廠每台伺服器的多太位元頻寬需求,確保資料不受傳輸瓶頸限制。 |
透過 Scale‑In,AI 工廠的基礎設施服務(如存取控制、資料搬移、租戶隔離)全部在 DPU 上執行,與主機 CPU 完全解耦。這帶來三大好處:
-
安全性提升:硬體層面的加密與檢測避免了軟體僅依賴 CPU 的攻擊面。
-
效能更可預測:因為基礎服務不與 AI 計算競爭 CPU 資源,網路延遲與吞吐量保持穩定。
-
運維更簡化:DOCA 提供統一的觀測與配置介面,讓資料中心營運人員可在單一平台管理多租戶環境。
未來展望與讀者啟示
隨著生成式 AI、機器人代理與自動化決策系統的快速擴散,代理式 AI 工廠將成為企業數位轉型的核心。NVIDIA 的 Scale‑In 為這類高密度、低延遲的運算環境提供了「硬體即服務」的新範式,讓資料中心不再是單純的計算叢集,而是一個 安全、可觀測且具彈性 的完整 AI 生態系。
對於關注 AI 基礎建設的決策者而言,未來在規劃新建或升級資料中心時,應將 DPU 加速的北向‑南向網路 列入必選項目;同時,透過 DOCA 生態系的開放介面,才能在多租戶與多樣化應用間保持靈活度與安全性。只有在硬體與軟體深度協同下,AI 計算的規模才能真正突破,為企業帶來持續的競爭優勢。
