預計閱讀 1 分鐘原文來源
NVIDIA 推出 Spectrum‑X 乙太網路 打造千兆規模 AI 資料中心
隨著生成式 AI 訓練規模突破百萬顆 GPU,資料中心的網路已成為首要瓶頸。傳統的商用乙太網路在處理大量、同步的 AI 計算流時,會遭遇物理限制。為填補這一缺口,NVIDIA 以硬體加速為核心,從頭設計了 Spectrum‑X 乙太網路,專為千兆級 AI 工廠打造。
為何傳統乙太網路不敷使用?
-
流量熵值差異
-
一般資料中心的流量熵值高,數百萬筆小型、獨立的封包四散而行,透過 等成本多路徑 (ECMP) 靜態雜湊 可均衡分配。
-
AI 訓練流量熵值低,GPU 之間以 All‑Reduce、All‑Gather、All‑to‑All 等集合運算不斷同步,形成少數幾條巨大的同步流。
-
-
頻寬‑延遲乘積龐大
- 在 800 Gbps 以上的速率,光速決定的傳播延遲固定不變,但頻寬‑延遲乘積極高,若網路無法在微秒級即時緩解擁塞,隊列將快速堆疊、封包遺失。
-
軟體控制回應不足
- 傳統乙太網路的擁塞控制多依賴軟體回饋,無法在上述微秒時間窗內作出反應,導致效能不穩。
Spectrum‑X 的核心架構
- 硬體全加速控制迴路:將控制功能依「範圍、訊號、責任」分離為三條互不干擾的迴路,確保在自然時間尺度內即時解決擁塞,避免回饋迴路產生震盪。
- 逐封包自適應路由 (Adaptive Routing, AR):相較於 ECMP 的靜態雜湊,Switch 會即時根據實際負載調整每一個封包的傳送路徑,提升布建利用率。
- Multiplane 技術:透過多層平面的布建設計,最大化二分頻寬,讓 AI 訓練的巨量同步流在不同平面上平行傳輸,進一步縮短 Time‑to‑AI(從模型啟動到完成訓練的時間)。
影響與未來展望
Spectrum‑X 的硬體加速與自適應路由,使得 AI 資料中心在千兆規模下仍能維持低延遲與高利用率,從根本上解除傳統乙太網路的瓶頸。未來,隨著模型規模持續擴張與新一代 GPU 推出,網路層面的 硬體/軟體協同設計 將成為資料中心競爭的關鍵。對於雲端服務供應商與企業自建 AI 超算中心而言,採用 Spectrum‑X 代表了向「預測式、彈性」網路架構轉型的第一步。
分享
