Nvidia 推出 Groq 3 LPX 推理加速器 提升代理式 AI 令牌生成速度
Nvidia 在 Hot Chips 2026 大會正式宣佈,專為推理(Inference)設計的 Groq 3 LPX 已進入全量產階段。此加速器被定位為「互動式 AI 推理加速器」,延伸自 Vera Rubin 平台,目標是為代理式 AI(Agentic AI)系統提供超高速的令牌(Token)生成能力,預計於今年底正式上線。
背景與技術亮點
- 收購與團隊整合:去年底,Nvidia 斥資約 200 億美元取得 Groq 授權,並將創辦人 Jonathan Ross 及總裁 Sunny Madra 招入旗下。Groq 原本專注於為推理而非訓練(Training)優化的處理器。
- 速度的重要性:在代理式應用中,AI 代理會在數百至數千次推理步驟中消耗大量令牌。令牌產出越快,單位時間內可完成的推理步驟與工具呼叫就越多,從而在使用者可接受的等待時間內完成更多檢查、程式碼編寫與測試。Nvidia 稱此可將編碼任務縮短至「分鐘級」而非「小時級」。
- Benchmark 成績:根據 Artificial Analysis 的測試,使用開源模型 Gemma 4 31B(上下文窗口 100 000 令牌)時,Groq 3 LPX 機架在 50 次連續請求下達到 3 400 令牌/秒,且在 10 000 至 100 000 令牌的輸入長度間表現穩定。Nvidia 表示,這相當於同類最佳 Cerebras 晶片(882 令牌/秒)的四倍。
架構限制與比較
Groq 採用大量 SRAM(靜態隨機存取記憶體)的資料流(Dataflow)架構,每顆 LPU(Logic Processing Unit)僅配備 500 MB 記憶體,遠低於 Rubin GPU 的 288 GB。因此大型模型必須在多顆加速器之間以以太網(Ethernet)切割分配,一個機架最多容納 256 顆 LPU。此混合式配置下,GPU 負責計算密集的「預填充」階段(Prefill),而 LPU 處理頻寬需求較高的「解碼」階段(Decode)。
The Register 指出,Gemma 4 31B 之所以能在單機架內完整運作,是一個「最佳案例」;對於更大型的 Mixture‑of‑Experts(混合專家)模型,如 DeepSeek V3,則可能需要 1 342 顆加速器,約五個機架才能容納。與此同時,Cerebras 僅需一至兩顆加速器即可支援相同模型,而 Nvidia 最低需 64 顆,且比較中未納入 Cerebras 最新的 CS‑4 代系統。
市場布局與未來展望
雲端服務提供商 Nebius 宣稱將成為首家透過其 Token Factory 供應 Groq 3 LPX 的業者,Groq 本身也已列入早期使用者名單。若加速器的高吞吐量能在真實代理式工作負載中持續展現,將有望加速企業在自動化客服、程式碼生成與決策支援等領域的部署。
然而,模型規模的擴張與記憶體瓶頸仍是關鍵挑戰。未來若 Nvidia 能在 SRAM 容量或跨機架記憶體共享上取得突破,Groq 3 LPX 的競爭優勢將更為明顯;反之,若其他廠商的全新晶片(如 Cerebras CS‑4)在效能與成本上取得平衡,市場格局仍可能保持多元。
結語:Groq 3 LPX 展示了專為代理式 AI 設計的推理加速器在令牌生成速度上的顯著提升,但其記憶體配置與擴展性仍需業界持續觀察。對於關注 AI 推理效能的企業與開發者而言,評估實際工作負載與硬體成本的匹配度,將是選擇是否採用此新平台的關鍵。
