降低 AWS EC2 上語音辨識推論成本的策略
綜合科技

降低 AWS EC2 上語音辨識推論成本的策略

AI News Bot
2026-08-28
預計閱讀 1 分鐘原文來源

降低 AWS EC2 上語音辨識推論成本的策略

在雲端 AI 應用中,**自動語音辨識(ASR)**的即時性與成本往往互相牽制。Heidi Health 每週處理超過 240 萬筆臨床諮詢,遍及 190 個國家,必須在次秒內完成文字轉寫。原先的部署因 GPU(圖形處理器) 使用率偏低而不得不投入 16 顆 GPU 實例,造成資源浪費。

背景與技術瓶頸

  • 單次 ASR 推論只佔 NVIDIA L40S GPU 142 個 SM(串流多工器) 的 15‑20%,其餘 80% 在每次前向傳播時閒置。
  • CUDA 的預設 時間切片(time‑slicing) 會讓每個進程獨占 GPU,導致 上下文切換(context switching) 開銷,且無法同時執行多個請求。
  • 在此情況下,一顆 GPU 只能支援約 62 RPS(每秒請求數),且延遲仍能維持在平均 < 650 ms、p99 < 1,000 ms 之內。為滿足峰值流量與 SLA(服務等級協議),Heidi 必須配置 16 顆 GPU。

解決方案:CUDA 多程序服務(MPS)+ Triton 推論伺服器

研究團隊測試了三種 NVIDIA GPU 共享機制,最終選擇 CUDA Multi‑Process Service(MPS) 結合 NVIDIA Triton Inference Server™ 在 Amazon EC2 GPU 實例上部署。MPS 能將同一顆 GPU 切分為多個執行實例,使得每個實例僅使用約 25% 的 SM,從而同時處理多筆推論請求,徹底填補先前的空閒容量。

  • 效能提升:每顆 GPU 可支援 92.1 RPS,較原先提升近 50%。
  • 成本縮減:所需 GPU 數量從 16 顆降至 4 顆,相當於 75% 的基礎設施縮減。
  • 延遲保持:即使在高併發下,仍能維持次秒內的回應時間,符合醫療應用的嚴格要求。

未來展望與讀者啟示

此案例顯示,GPU 共享技術在高頻率、低佔用的推論工作負載中具備顯著的成本效益。對於其他需要即時語音或影像辨識的雲端服務,採用 MPS 搭配 Triton 可望同樣減少資源浪費,提升服務彈性。未來隨著模型規模持續增長,如何在保持低延遲的同時進一步優化多租戶隔離與資源分配,將成為雲端 AI 基礎建設的重要課題。

分享