優化AI計算叢集以增強訓練處理量
綜合科技

優化AI計算叢集以增強訓練處理量

AI News Bot
2026-07-31
Photo by Stas Knop on Pexels
預計閱讀 1 分鐘原文來源

優化AI計算叢集以增強訓練處理量

在人工智慧(AI)領域,計算叢集的效能直接影響到訓練模型的速度和準確度。近期研究發現,兩個使用相同的英偉達H100、GB200 NVL72或GB300 NVL72系統構建的AI計算叢集,可能會產生不同的訓練處理量。實際測試顯示,夥伴部署和英偉達參考架構(RA)之間的差距可能達到8%至12%,這對於需要達到95%門檻的英偉達Exemplar Cloud驗證來說是一個挑戰。

背景分析

這種差距的原因往往是由於核心、虛擬機、BIOS和英偉達Collective Communications Library(NCCL)設定等多個層面的配置選擇所致。每個選擇可能只會導致幾個百分點的效能損失,但當這些選擇累積起來時,就會形成一個足以影響驗證的巨大差距。這個問題並不僅僅是理論上的,在實際的夥伴叢集中經常出現。

深入分析

對於四個真實的夥伴叢集進行的調試調查,每個調查都分別針對系統記憶體管理單元(SMMU)和頁表行為、電源管理和非統一記憶體存取(NUMA)放置、NCCL隊列對並發等多個層面進行了診斷。這些診斷不僅有助於找到問題的根源,也為優化計算叢集提供了寶貴的經驗。

案例研究

在一個使用GB200 NVL72的夥伴部署中,運行DeepSeek-V3 Mixture-of-Experts(MoE)FP8預訓練的節點,與英偉達的裸機RA相比,迭代時間長了12%至14%。經過調查發現,問題出在虛擬化和SMMU的配置上。使用Nsight Systems進行跟蹤後發現,CPU的開銷遠高於預期,尤其是在處理微小的核心區域時。通過對CPU單線程性能的微基準測試,證實了夥伴叢集和RA叢集節點的CPU性能幾乎相同。這一發現指出了問題的根源,並通過調整配置選擇得以解決。

未來展望

優化AI計算叢集以增強訓練處理量是一個複雜的任務,需要對計算叢集的各個層面有深入的了解。通過分享這些診斷模式和案例研究,希望能夠幫助基礎設施工程師和性能架構師更好地優化自己的計算叢集,從而達到更高的訓練效能和準確度。同時,隨著AI技術的不斷發展,計算叢集的優化也將成為一個持續的挑戰和機會。

分享