OpenAI 首度公開自研推論晶片 Jalapeño:效能大幅提升
OpenAI 近日公布其首款自研推論晶片 Jalapeño 的完整測試結果,與 Nvidia 的 GB200、GB300 兩代加速卡相比,三款大型語言模型在 每瓦吞吐量(峰值效能/功耗)提升 1.5 至 1.9 倍,端到端回應延遲則縮短 43% 至 72%。第一代 Jalapeño 預計在 2026 年底開始部署,第二代已進入深入開發階段。
背景與技術重點
大型語言模型(LLM)在推論時需要同時處理大量輸入文字與逐 token 產生回應,兩者對 運算單元 與 記憶體 的需求截然不同。OpenAI 在 Jalapeño 的設計上,著重於 減少資料搬移 與 晶片間通訊,將生成回應時頻繁使用的 KV 快取(Key‑Value cache)等資料盡可能保留在本地記憶體,避免跨單元傳輸造成的等待時間。
測試採用了 SemiAnalysis 公開的 InferenceX 基準,從系統接收使用者請求到完成回應的完整流程皆納入評估。三款模型分別為:
| 模型 | 比較基準 | 峰值每瓦吞吐量提升 | 完整回應時間(秒) | |------|----------|-------------------|-------------------| | GPT‑OSS 120B | Nvidia GB200 | 約 1.9 倍 | 5.99 → 1.65 | | DeepSeek R1 670B | Nvidia GB300 | 約 1.7 倍 | 5.99 → 1.65 | | Kimi K2.5 1T | Nvidia GB300 | 約 1.5 倍 | 5.31 → 1.56 |
其中,DeepSeek R1 與 Kimi K2.5 的回應時間皆縮短至約 1.6 秒,顯示 Jalapeño 在降低 端到端延遲 方面表現尤為突出。
AI 助力程式最佳化
OpenAI 亦利用自家 AI 工具(Codex 搭配 GPT‑Astra)協助晶片程式碼的最佳化。團隊在兩個月內將三款原本未列入 Jalapeño 生產規畫的開放權重模型(開放來源模型)調校至高效能水平,注意力機制與混合專家模型的運算區塊因 AI 產生的實作速度較傳統人類專家版快 1.5 至 1.8 倍。
影響與未來展望
Jalapeño 的效能突破不僅提升 OpenAI 自家服務的成本效益,也可能改變業界對 加速器供應鏈 的依賴格局。OpenAI 明言未來仍會與 Nvidia 及其他合作夥伴共同使用加速卡,支援模型訓練與推論;但自研晶片的成功驗證,為其在硬體層面的自主性奠定基礎。
第二代 Jalapeño 已進入深入開發,第三代亦在規畫中。若後續版本能持續縮減功耗、提升吞吐量,將加速大型語言模型在雲端與邊緣裝置的部署,進一步推動 人工智慧 應用的普及化。
讀者提示:隨著晶片效能提升與延遲下降,未來使用 LLM 的即時對話、內容生成與程式輔助等服務將更為流暢,企業與開發者可關注 OpenAI 的部署時程,適時調整雲端資源與成本策略。
