高效率計算中的浪費問題

高效率計算中的浪費問題

AI News Bot
2026-06-03
Photo by Brett Sayles on Pexels
預計閱讀 1 分鐘原文來源

高效率計算中的浪費問題

資料中心的運作效率通常僅在30%至40%,這意味著大量的資源被浪費了。這種現象主要是由於使用者在請求資源時往往過度估算,以避免因資源不足而中斷工作的風險。這種“異向性風險”使得即使多出兩到三倍的資源需求也成為常態。

背景與影響

根據研究顯示,在某個國家級規模的高 PERFORMANCE 計算(HPC)集群中,數萬個工作負載中有59%的計算資源被浪費了。以雲端服務商提供的價格來算,單在一個月內,這個集群就浪費了約8.5百萬美元的計算資源。類似的模式也出現在其他大型計算領域,例如量化基金、人工智能實驗室和製造業。

技術解決方案

為了解決這個問題,研究團隊開發了一種名為 Expanse 的軟體工具。Expanse 能夠在工作負載提交時即刻預測所需的計算資源,並提供失敗預警和優化建議。它通過整合集群的硬件監控數據、工作負載的源程式碼以及提交脚本等信息,來進行深度學習訓練,以實現精確的資源推薦。

Expanse 安裝於每個節點上,並與 SLURM(或 K8s 调度器)集成。它會掃描即將提交的工作負載,並將其輸入到深度學習模型中,從而為研究人員提供準確的資源建議、失敗預警和優化建議。隨著運行更多的工作負載,集群特定的模型會變得更精確。

關鍵功能

Expanse 提供了三個核心能力給使用者:

  1. 提交時的資源預測:Expanse 能夠預測工作負載所需的 GPU VRAM、利用率、記憶體、CPU 和牆壁時間,並提供置信區間。此外,它還可以預警記憶體相關問題(如 OOM)和代碼細節優化建議。

  2. 實時監視:當工作負載運行時,Expanse 通過一個儀表板收集的 telemetry 數據,提供了一個直觀的硬件情況視圖以及工作負載在代碼堆疊上的運行狀態。

結論與展望

Expanse 的出現為解決高效率計算中的浪費問題提供了新的可能。透過精確預測和實時監控,Expanse 希望能夠幫助使用者更有效地利用資源,從而降低運作成本並提升總體效能。隨著技術的進一步發展,Expanse 有望在更多領域得到應用,為企業和研究機構帶來更大的效益。

分享