
核心亮點
OpenAI 於 Hot Chips 會議首次公開 Jalapeño AI 推理晶片的基準測試,宣稱在 throughput per watt(每瓦特吞吐量) 以及 token latency(詞元延遲) 兩項指標上均超越 Nvidia 的 Blackwell 與 Vera Rubin 平台。測試顯示,Jalapeño 在峰值吞吐時可提供 1.5‒1.9 倍 的 AI 工作量/瓦,端到端延遲降低 1.7‒3.6 倍,互動工作負載的效能提升 2.1‒4.1 倍。
背景與技術分析
Jalapeño 僅支援 推理(inference),不具備訓練功能,亦未針對 OpenAI 自家模型特別調校,定位為通用大型語言模型(LLM)推理加速器。測試使用 SemiAnalysis 公布的 InferenceX 基準,涵蓋三款模型:
- GPT‑OSS 120B:約 1,400 token/秒/使用者
- Deepseek R1 670B:單一併發請求下突破 700 token/秒
- Kimi K2.5 1T(數據未列出)
值得注意的是,Jalapeño 在測試中未使用 multi‑token prediction(多詞元預測) 或 speculative decoding(推測解碼) 等加速技巧,而部分競品系統則已採用這些優化,說明其效能仍有提升空間。SemiAnalysis 現場驗證了部分測試結果,並指出即使在使用相同 HBM4 記憶體的 Vera Rubin 上,Jalapeño 仍能在每兆瓦產出更多詞元,總擁有成本(TCO)則大致持平。
晶片由 OpenAI 與 Broadcom 合作開發,設計於 2024 年中啟動,2025 年 11 月送至代工廠,整個研發週期約 16 個月,其中首次設計到藍圖完成僅耗時 9 個月。OpenAI 表示,開發期間廣泛使用自家舊代模型協助晶片設計,新代模型則加速程式碼優化與驗證。
產業影響與未來展望
SemiAnalysis 觀察到,此次成果挑戰了 Nvidia 長期以 CUDA(Compute Unified Device Architecture)建立的「技術護城河」——即使 CUDA 仍是業界主流,OpenAI 以自研晶片快速迭代模型的能力,已讓該護城河出現動搖。
然而,仍有幾項限制需留意:
-
Nvidia 與 AMD 已公布在更大型模型(如 Deepseek V4 Pro、Kimi K3)上的測試成績,Jalapeño 尚未驗證。
-
Vera Rubin 已開始量產交付客戶,Jalapeño 目前仍停留在工程樣本階段。
未來若 OpenAI 能將 Jalapeño 量產並持續整合多詞元預測等優化技術,預計在大型語言模型服務成本與回應速度上將產生顯著變革,亦可能促使其他 AI 企業加速自研硬體,形成新一輪的算力競賽。對於關注 AI 成本結構與效能的企業與開發者而言,持續追蹤 Jalapeño 的量產進度與軟硬體生態整合,將是掌握未來競爭優勢的關鍵。