AWS 為 SageMaker HyperPod 推出 Ray 整合,加速基礎模型訓練與服務
AI 奇點前沿

AWS 為 SageMaker HyperPod 推出 Ray 整合,加速基礎模型訓練與服務

AI News Bot
2026-08-25
預計閱讀 1 分鐘原文來源

AWS 為 SageMaker HyperPod 推出 Ray 整合,加速基礎模型訓練與服務

核心重點

AWS 今日正式在 Amazon SageMaker HyperPod 上加入 Ray 整合功能,讓資料科學家能在 SageMaker Studio 內直接建立、管理與觀測 Ray 叢集,省去編寫 Kubernetes YAML、手動重建 Docker 映像、設定 Port‑Forward 以及自行佈署 Prometheus/Grafana 等繁雜步驟。此舉大幅簡化分散式 Python 工作負載(訓練與服務)的部署流程,同時結合 HyperPod 的節點健康監控與階層式儲存,提升容錯與恢復速度。

背景說明

  • Ray:一套開源框架,支援 Ray Train(分散式模型訓練)與 Ray Serve(模型服務),可在 GPU 叢集上自動平行化 Python 程式。
  • KubeRay:在 Kubernetes 上管理 Ray 叢集的開源 Operator,透過自訂資源(RayCluster、RayJob、RayService)控制叢集生命週期。
  • SageMaker HyperPod:為大型機器學習(ML)工作負載打造的專屬基礎建設,部署於 Amazon EKS(Elastic Kubernetes Service),內建節點健康檢測與自動復原機制。
  • SageMaker JumpStart:提供即時可用的基礎模型與範例程式碼,現在可直接將模型權重載入 Ray Serve 端點,並支援 KV cache(鍵值快取)下放至階層式儲存,以因應長上下文請求。

具體功能與影響

  1. 一鍵建立 Ray 叢集:使用 SageMaker Studio 的圖形介面,即可在 HyperPod 上部署 RayCluster,免除手寫 YAML。

  2. 即時觀測:Ray Dashboard 與 Amazon Managed Grafana 觀測面板自動開啟,提供 CPU、GPU、記憶體與網路使用率的即時圖表。

  3. 開發環境整合:JupyterLab 或 Code Editor 可直接連線至 Ray 叢集,提交分散式作業(Ray Job)時,系統會自動偵測掛起作業並觸發警示。

  4. 容錯與快照:HyperPod 的節點健康監控與自動復原機制,使 Ray 訓練作業具備自動容錯;同時支援階層式檢查點(tiered checkpoint),透過 HyperPod 分散式階層式儲存加速作業恢復。

  5. 模型服務即插即用:JumpStart 整合讓模型權重直接注入 Ray Serve 端點,且 KV cache 可自動卸載至階層式儲存,提升長序列推論效能。

這些功能均兼容開源 KubeRay 與標準 Ray API,現有的腳本與工作流程無需修改即可受惠。

未來展望

Ray 與 HyperPod 的深度結合,為大型基礎模型(Foundation Model)的訓練與部署提供了「即開即用」的雲端環境。隨著模型規模持續擴張,資料科學家將能更專注於演算法創新,而非基礎設施維護。未來若 AWS 再度擴充 HyperPod 的硬體規格(如更高密度的 GPU、NVMe 階層式儲存),配合 Ray 的彈性調度,將可能成為企業在雲端建置超大規模 AI 服務的首選平台。對於關注成本效益與開發速度的企業而言,現在正是評估並遷移至 SageMaker HyperPod + Ray 生態系的最佳時機。

分享