在 SageMaker HyperPod 上使用 NVIDIA Cosmos 3 建構持續性的實體 AI 模型工廠
機器人與自動化

在 SageMaker HyperPod 上使用 NVIDIA Cosmos 3 建構持續性的實體 AI 模型工廠

AI News Bot
2026-09-05
Photo by UMA media on Pexels
預計閱讀 1 分鐘原文來源

在 SageMaker HyperPod 上使用 NVIDIA Cosmos 3 建構持續性的實體 AI 模型工廠

核心概念

實體 AI 系統(例如機器人或自動駕駛車)無法只靠一次訓練完成。它需要一條 持續循環的管線:產生合成資料 → 後訓練感知與策略模型 → 在閉環模擬中評估。將這整個循環不間斷地執行,即是所謂的 實體 AI 模型工廠,把不斷湧入的真實世界資料轉化為更佳的模型。


為何需要完整的容量承諾?

在傳統作法中,各階段往往會分別購置 GPU,導致:

  1. 供應變動:不同時間點取得的 GPU 可能在可用區域或 AWS 區域上與資料位置不一致。

  2. 資源浪費:每個階段的節點需自行啟動與關閉,管理成本高。

透過 一次性承諾整條管線的 GPU 容量,可避免上述波動。此時成本衡量的指標不再是單一工作負載的峰值吞吐量,而是 GPU goodput(每保留 GPU 小時所產生的實際管線進度)。


NVIDIA Cosmos 3 的突破

Cosmos 3 是一個 開放式全模態(omnimodal)基礎模型,在 Linux Foundation 的 OpenMDW‑1.1 授權下釋出。它將影像、影片、動作與聲音等多種感官資訊視為 單一 token 流,同一個 Transformer 主幹(transformer trunk)可在三種模式下運作:

| 模式 | 功能說明 | |------|----------| | 前向動態世界模型 | 產生合成影片,模擬未來情境 | | 逆向動態動作標記器 | 從影片中自動標註動作序列 | | 可部署的動作策略 | 直接輸出可在機器人或車輛上執行的控制指令 |

因為 同一模型族 同時涵蓋生成、後訓練與評估三大工作負載,這三個階段不必再各自配置獨立的 GPU 池,而是 共享同一個持久且具彈性的 GPU 節點池,由單一叢集控制平面(cluster control plane)統一排程。這種時間共享(time‑shared)方式大幅提升資源利用率,降低運維複雜度。


實作資源與未來展望

完整的部署腳本、基礎建設模板與工作負載清單已放在 awsome‑distributed‑ai GitHub 倉庫,使用者可直接下載並在 SageMaker HyperPod 上建立完整的模型工廠環境。隨著 GPU 容量的持續預留與 Cosmos 3 的全模態能力,未來的實體 AI 系統將能更快速迭代、即時回饋,縮短從資料收集到模型部署的閉環時間。

結語

將實體 AI 的全流程整合於單一模型與單一 GPU 池,不僅解決了資源碎片化的痛點,也為大規模、持續性的 AI 研發提供了可預測的成本結構。對於希望在雲端打造自動化 AI 製造線的企業而言,SageMaker HyperPod 搭配 NVIDIA Cosmos 3 已成為一條值得關注的路徑。

分享