NVIDIA 推出 AI 叢集執行環境 1.0 簡化 GPU‑Kubernetes 相容性
英偉達(NVIDIA)近日發佈 AI Cluster Runtime(AICR) 1.0,針對 GPU 加速的 Kubernetes 叢集提供「版本鎖定、驗證配方」的完整解決方案。過去,從主機核心、GPU 驅動、容器執行階段、網路、儲存、裝置外掛到排程器與工作負載框架,皆各自遵循不同的發佈週期。只要升級其中任一元件,原本可運作的組合就可能在部署後悄悄失效,排查衝突既耗時又易出錯。AICR 透過**配方(recipe)**將相容的元件組合固定下來,並產出可直接使用於 Helm、Argo CD、Flux 或 Helmfile 的部署檔案,同時附帶硬體測試的簽名驗證證據,確保每一套配置在實際機器上已通過驗證。
版本鎖定與公開介面的穩定合約
AICR 1.0 明確規範了 CLI、REST API、Go SDK、套件佈局與產出檔案的結構,形成 v1.x 相容性政策。這讓叢集管理員、系統整合商以及開源貢獻者能在同一套公共介面上安全地開發、測試與擴充。驗證儀表板提供多維度搜尋功能,使用者可依服務類型、GPU 型號、作業系統、工作負載意圖或平台條件快速定位符合需求的配方,並檢視其驗證狀態與硬體證據。
生態系統的擴散與貢獻者網絡
除了英偉達內部的測試團隊,AICR 已吸納超過 100 位貢獻者,其中近半數來自英偉達以外的社群。Pulumi Labs 以基礎建設即程式碼(IaC)提供者的方式將 AICR 暴露給開發者;Mirantis 的 k0rdent 整合則將其打包成多叢集管理工具。這兩個案例顯示,一次定義的 GPU‑Kubernetes 配置可以被多種工具重複使用,降低了跨團隊協作的摩擦。
為何配方模型成為關鍵
傳統上,哪種元件組合可行、如何驗證往往散落於不同的驗證系統、部署腳本與作業手冊,導致團隊在發現、重現或更新配置時必須自行拼湊資訊。AICR 的配方模型把這些碎片化的知識集中於一處,並以簽名的驗證證據作為可信任的依據,避免了僅靠「安裝成功」就認為叢集已符合需求的錯誤假設。
未來展望
隨著 AI 工作負載對 GPU 效能的依賴日益加深,叢集相容性的管理將成為企業雲端策略的核心。AICR 1.0 為此提供了可擴充的基礎框架,未來若能持續納入新一代 GPU、不同的容器執行時與雲端平台,將進一步縮短部署週期、降低運維風險。對於希望在多雲或混合雲環境中保持一致性與可觀測性的技術負責人而言,採用 AICR 代表了一條 「一次定義、全域使用」 的可靠道路。
