預計閱讀 1 分鐘原文來源
核心概念
NVLink Fusion 與 NVHBM 為英偉達(NVIDIA)打造的雙軸加速平台,讓超大型模型與複雜推理工作負載的 AI 工廠,能在 機架等級(rack‑scale) 直接部署客製化 XPU(AI 加速器) 與 CPU,並以高頻寬記憶體(HBM)維持算力供給。
背景與技術挑戰
AI 工廠面臨三大瓶頸:
-
模型規模 持續膨脹,需要更寬的記憶體頻寬才能快速讀取權重與 KV 快取(key‑value cache)資料。
-
封裝與電源 必須同時容納更多算術單元、有效的電力傳遞與熱設計,才能在同一晶片上提升算力密度。
-
供應鏈與驗證 高階 HBM 與封裝技術的驗證流程冗長,會拖慢客製化加速器的上市時間。
NVLink Fusion 與 NVHBM 的雙重效益
- NVLink Fusion:提供一套完整的 IP(智慧財產權)與連接技術,讓超大規模雲端服務商與 AI 原生公司,能在英偉達的 MGX 機架架構 內,快速將自研 XPU 與 CPU 整合。此技術減少開發與部署的複雜度,同時提升整體效能與上市速度。
- NVHBM:為客製化 HBM 基底晶片(base‑die),與領先記憶體供應商共同驗證。相較於標準 HBM4e,每層堆疊的記憶體頻寬提升 最高 30%,同時在晶片面積與功耗上取得更佳的平衡。對於記憶體受限或部分受限的 AI 工作負載,這意味著加速器的利用率提升、吞吐量增加,尤其在大型模型推論時,可加速資料在 HBM 與運算核心之間的搬移,提升每位使用者的 token 處理速度。
NVLink Fusion 進一步將多顆加速器在機架層級串聯,使 分散式算力與記憶體 能更有效協同,對於 Expert Parallelism(專家平行) 或 WideEP(寬度專家平行) 等先進路由技術尤為關鍵。
未來展望
隨著 AI 模型規模突破百億參數,高頻寬記憶體與機架級互連 成為不可或缺的基礎建設。NVLink Fusion 與 NVHBM 的結合,為 AI 原生公司提供了「半客製化」的加速器平台,既保留彈性,又降低驗證與供應鏈風險。未來若能持續擴充 MGX 架構的模組化設計,AI 工廠將更快完成從單卡測試到全機架部署的轉換,為業界帶來更高效的模型訓練與推論服務。
分享
