NVLink Fusion:為半客製化 AI 工廠注入高速互連血液
在規模化產出智慧的今天,AI 工廠的經濟指標已不再是單純的運算速度,而是 每秒產出多少 token、每瓦耗電產出多少 token、每 token 成本、設備利用率與正常運作時間。要達成這些目標,僅靠單顆加速器已不足以支撐,必須以「完整工廠」的概念規劃整體 AI 基礎建設——包括擴充式與橫向擴展的網路、機架層級架構、量產軟體堆疊以及穩定的供應鏈生態。
為何傳統 XPU 開發成本高企
大型雲端服務商與 AI 原生公司在打造自家 XPUs(可程式化運算單元) 時,往往只聚焦於晶片設計本身,卻忽視了將創新晶片推向資料中心所需的網路與系統整合工作。這些工作包括:
- Scale‑up 網路:在單機內部多顆 XPU 之間的高速互連
- Scale‑out 網路:跨機架、跨資料中心的資料傳輸
- 機架級軟硬體協同:確保資源配置與效能最大化
- 供應鏈與測試:從 ASIC 設計到光學互連的完整驗證
上述環節若自行開發,時間與資金成本皆相當龐大,成為新 XPU 迅速上市的主要障礙。
NVLink Fusion 的核心價值
NVLink Fusion 透過將客製化 XPU 直接接入 NVIDIA 先進的 AI 基礎建設,提供三大關鍵優勢:
-
高頻寬、低延遲的 Scale‑up 互連
第六代 NVLink(NVIDIA 的高速互連技術)在 72 顆 XPU 的領域內提供領先的頻寬與低延遲。XPU 之間的端對端傳輸延遲比傳統以太網方案低 3 倍,封包速率高出 10 倍,確保大型模型(如千兆參數模型、Mixture‑of‑Experts 架構)在運算時不會因網路瓶頸而降低利用率或提升 token 成本。
-
NVL72 系統提升整體吞吐
搭配 NVIDIA GB300 NVL72 伺服器,可在不使用 NVL72 的配置上實現顯著的吞吐量提升與互動性改善。未來路線圖更規劃支援至 1,152 顆加速器的領域,並加入共封裝光學模組,為更大規模的 AI 工廠鋪路。
-
NVLink‑C2C 連接 CPU 與 XPU
NVLink‑C2C(Chip‑to‑Chip)讓 XPU 能直接與 NVIDIA Vera CPU 或其他合作夥伴的 CPU 互連,能源效率比 PCIe(周邊元件互連)高 6 倍,減少控制層與計算層之間的瓶頸,特別適用於需要即時決策的代理式 AI 系統。
生態系統與快速落地
NVLink Fusion 不僅提供硬體互連,還搭建了一條從 ASIC 設計、CPU、IP(智慧財產權)到光學互連的完整合作鏈。開發團隊因此可以把創新焦點放在 XPU 本身的演算法或架構優化上,其他成熟技術則直接採用 NVIDIA 的解決方案,縮短從概念驗證到資料中心部署的時間。
未來展望
隨著 AI 模型規模持續突破「千億」甚至「兆級」參數,Scale‑up 網路的效能將直接決定工廠的成本結構與競爭力。NVLink Fusion 以其高頻寬、低延遲與能源效率的特性,為半客製化 AI 工廠提供了一條「快速、低風險」的路徑。對於希望在 AI 市場快速占領先機的企業而言,選擇 NVLink Fusion 意味著可以在保持創新彈性的同時,依賴成熟的基礎建設加速產品上市。
結語:在 AI 基礎設施的競賽中,硬體本身不再是唯一的制勝因素。透過 NVLink Fusion,企業能在「客製化 XPU」與「成熟互連」之間取得最佳平衡,從而在 token 成本、能源使用與系統可靠性上取得全方位的提升。未來,隨著 NVLink 技術持續演進,半客製化 AI 工廠的規模與效率將有望再上新高。
