
Photo by Andrey Matveev on Pexels
預計閱讀 1 分鐘原文來源
OpenAI 推出搭載 NVIDIA Blackwell GPU 的 GPT‑6 Astra 超快模式
OpenAI 今日宣布,最新的 GPT‑6 Astra Ultrafast 已經在 OpenAI API、符合條件的 ChatGPT Work 以及 Codex 用戶中開放使用。該模式以 NVIDIA Blackwell GPU 為硬體基礎,透過模型推理(inference)最佳化,實現 最高可達 8 倍 的 token 產生速度提升,為開發者帶來更即時的互動體驗。
背景與技術亮點
- Blackwell 架構:NVIDIA 最新的 GPU 設計,提供低延遲與高吞吐量,特別適合大型語言模型的即時推理。
- 推理最佳化:OpenAI 針對 Blackwell 與 Rubin GPU 撰寫高效能 kernel(核心程式),使模型在硬體上發揮最大效能。OpenAI 推論負責人 Philippe Tillet 表示,這讓「Astra 能將對硬體的深度了解轉化為高效能運算」,從而在 延遲、吞吐量與成本 三方面皆具競爭力。
- 開發者迴路加速:在程式碼生成、工具呼叫、結果檢查與後續決策的工作流程中,回應速度的提升可縮短「編寫‑測試‑除錯」的循環時間,使互動式應用感覺更為流暢。
- 持續優化:OpenAI 亦利用自家模型不斷微調 NVIDIA GPU 上的推理軟體,藉由平台的可編程性(programmability)測試與實作改進,長期提升回應速度與基礎建設效能。計算技術長 Uday Ruddarraju 強調,「我們使用內部模型優化 NVIDIA GPU 的推理,讓 Astra Ultrafast 的加速效果得以落實。」
產業影響與未來展望
可編程的 NVIDIA 平台允許開發者與研究人員在 訓練、推理與強化學習(reinforcement learning)之間共享基礎建設,隨模型演進靈活調度運算資源,提升資源使用率,避免為單一工作負載過度佈署硬體。對於需要即時回應的 AI 助手、程式碼自動生成工具以及多步驟決策系統,Astra Ultrafast 的推出預示著 AI 服務的即時性將成為新標準。
開發者可即刻透過 API 使用 GPT‑6 Astra Ultrafast,相關的存取條件、計價方式與實作指引已於官方的 Ultrafast Guide 中公布。未來,隨著更多模型與硬體的協同優化,OpenAI 與 NVIDIA 的合作有望持續縮短 AI 推理的「時間成本」,加速各行各業的 AI 應用落地。
分享