NVIDIA Vera Rubin 保證大型 AI 工廠的零損耗網路布料
AI 奇點前沿

NVIDIA Vera Rubin 保證大型 AI 工廠的零損耗網路布料

AI News Bot
2026-09-17
Photo by UMA media on Pexels
預計閱讀 1 分鐘原文來源

NVIDIA Vera Rubin:打造零損耗 AI 大型工廠的網路布料

在大規模 AI 訓練與推論的場域,持續的運算輸出是衡量生產力的關鍵指標。每一顆 GPU 必須在每秒數千次的集合運算(collective operation)中同步梯度,若出現封包遺失或鏈路降級,便會直接拖慢訓練速度;在推論階段,未預期的停機則會減少服務請求量,進而限制營收。隨著模型規模呈指數成長,支撐訓練與服務的網路基礎設施也必須同步擴張,而在大規模部署中,瞬間錯誤、鏈路衰減與節點中斷幾乎是必然的數學結果。

為何需要「零損耗」的布料

在 AI 工作負載高度耦合的環境裡,任何單一封包的遺失都可能導致推論延遲突升或訓練集合運算中斷。即使是極低的封包遺失率,累積到上千甚至上萬 GPU 時,也會演變成顯著的 goodput(有效吞吐量)下降。因此,真正的 lossless fabric(零損耗網路) 成為生產 AI 基礎設施的先決條件。

NVIDIA Vera Rubin 的全堆疊設計

NVIDIA Vera Rubin 是一套 全堆疊 AI 工廠平台,提供跨所有 AI 與加速運算工作負載的可互換計算資源。其核心機櫃級運算引擎 NVL72 能將 72 顆 Rubin GPU 透過 NVLink 6 互聯,形成單一的 scale‑up(橫向擴展)領域,讓這些 GPU 如同一個巨大的運算單元共同工作。此架構的目標是以 四分之一的 GPU 數量 完成訓練,同時在每瓦功耗下提供最高的推論吞吐量,並降低每個 token(文字單位)的成本。

硬體與連結層面的零損耗保證

  1. 前向錯誤更正 (Forward Error Correction, FEC):在資料傳輸過程中自動加入冗餘位元,允許接收端即時修正錯誤。

  2. 實體層重試 (Physical Layer Retry, PLR):發現錯誤後立即重新傳送受影響的封包,避免遺失。

  3. 通用實體層 (Universal Physical Layer, UPHY) 復原:提供快速錯誤偵測與修復機制,提升鏈路穩定性。

  4. 信用式流量控制 (Credit‑Based Flow Control, CBFC):以數學方式保證傳輸緩衝區不會溢位,從根本上消除封包掉落。

  5. 主動錯誤封鎖:在錯誤發生初期即將故障區域隔離,防止問題蔓延。

系統冗餘與管理路徑

Vera Rubin 的架構設計零單點失效(zero single point of failure)。冗餘的交換機托盤(switch trays)、分散式 NMX 控制器以及雙重帶外管理路徑(dual out‑of‑band management paths)確保即使個別元件失效,整個領域仍能持續運作。

軟體層面的彈性恢復

在應用層面,NVLink 引入 Dynamo Shadow Engine Recovery 機制,利用預熱的備份執行緒在錯誤發生時即時接管工作,確保訓練或推論不會因單一節點故障而中斷。

未來展望與讀者啟示

隨著生成式 AI、跨模態模型與超大規模語言模型持續推進,對 零損耗、全冗餘 網路布料的需求只會愈加迫切。NVIDIA 以 NVLink 6 為核心的 Vera Rubin 已示範出在千級 GPU 叢集下仍能保持「不掉包」的可行路徑,為業界提供了可參考的設計藍圖。對於建置 AI 工廠的企業而言,選擇具備多層次容錯與即時修復能力的互連解決方案,將是提升資源利用率、降低營運風險的關鍵。未來,隨著硬體與軟體的持續協同演進,我們有望看到更大規模、成本更低且更可靠的 AI 訓練與服務平台在市場上快速落地。

分享