
AWS SageMaker 30B MoE 大語言模型 GPU 執行效能基準測試
在生成式 AI 逐步成為企業核心服務的今天,GPU 選型是影響 LLM(大型語言模型)推論成本與效能的關鍵因素。AWS 於 SageMaker AI 推薦服務中,針對兩款 30 億參數的 Mixture‑of‑Experts(MoE) 模型—Qwen3‑Coder‑30B 與 NVIDIA Nemotron‑3‑Nano‑30B,分別在 G5、G6、G7 三代 GPU 實例上執行基準測試,驗證新一代 NVIDIA Blackwell(RTX PRO 4500) GPU 的實際表現。
測試配置與工作負載
| 實例類型 | GPU 型號 | 數量 | 總顯存 | 主要工作負載 | |----------|----------|------|--------|--------------| | ml.g5.12xlarge | NVIDIA A10G | 4 | 96 GB | 程式碼生成、除錯(Qwen3‑Coder) | | ml.g6.12xlarge | NVIDIA L4 | 4 | 96 GB | 同上 | | ml.g7.12xlarge | NVIDIA RTX PRO 4500 Blackwell | 2 | 64 GB | 同上 | | ml.g6e.12xlarge | NVIDIA L40S | 4 | 192 GB | 推理、問答(Nemotron‑3‑Nano) | | ml.g7.12xlarge | NVIDIA RTX PRO 4500 Blackwell | 2 | 64 GB | 同上 |
測試採用 SageMaker AI DJL Large Model Inference(LMI) 容器與 vLLM(高效能 LLM 推論引擎)兩種服務堆疊,分別以直接基準與自動最佳化兩種方式比較 吞吐量(throughput)、延遲(latency) 與 每字元成本(cost‑per‑token)。
主要發現
-
效能提升顯著:即使 G7 僅使用兩顆 GPU(總顯存僅為 G5/G6 的一半),在 時間到首個 token(time‑to‑first‑token) 與 整體延遲 上均優於前代實例,說明 Blackwell 架構在模型切分與記憶體帶寬上的優化效果明顯。
-
成本效益更佳:因吞吐量提升,單位 token 的耗費成本下降,尤其在代碼生成與推理工作負載下,G7 的 price‑performance(價格‑效能比)超過 G5、G6 兩代。
-
彈性選型:透過 SageMaker AI Generative AI Inference Recommendations,使用者只需提供模型與工作負載,即可自動產出最適 GPU 配置,省去手動測試的時間與資源。
背後意義
- MoE 架構 允許大型模型在不同 GPU 之間分配「專家」子網路,降低單卡記憶體需求,這也是 G7 能以較少顯存達成高效能的關鍵。
- Blackwell GPU 的新世代記憶體子系統與高速互連,對 大型模型切片(model parallelism) 與 序列化推論 提供更佳支援,未來隨著模型規模持續擴大,這類硬體升級將成為降低 AI 成本的主要推手。
未來展望
隨著企業對生成式 AI 的需求從概念驗證走向全量化部署,自動化的效能推薦與基準工具 將成為雲端平台的核心競爭力。AWS SageMaker 已示範透過 G7 實例結合 MoE 模型,可在保持高品質輸出的同時,顯著降低每字元成本。對於想在 成本與效能之間取得最佳平衡 的技術團隊而言,未來可持續關注新一代 GPU(如 Blackwell)與 SageMaker AI 推薦服務的演進,將有助於在激烈的 AI 競賽中保持領先。