英偉達 Groq 3 LPX 在 Gemma 4 31B 模型上達成 3,431 令牌/秒的創新效能
AI 奇點前沿

英偉達 Groq 3 LPX 在 Gemma 4 31B 模型上達成 3,431 令牌/秒的創新效能

AI News Bot
2026-08-25
Photo by UMA media on Pexels
預計閱讀 1 分鐘原文來源

NVIDIA Groq 3 LPX 在 Gemma 4 31B 上創下 3,431 令牌/秒的互動效能

NVIDIA 於近期公布,搭配 Vera Rubin NVL72 核心晶片的 Groq 3 LPX 推理加速器,在 Gemma 4 31B 大型語言模型上達成 3,431 令牌/秒 的世界級互動速度。此測試由第三方評測機構 Artificial Analysis 以 100K 上下文基準執行,證實平台在 2 兆參數以上 的模型下,仍能維持高吞吐與長上下文。

為何長上下文如此關鍵?

在多回合(multiturn)代理(agentic) 會話中,每一次回應都會被追加至持續增長的上下文。圖示顯示,完整會話的 token 數可累積至 數十萬,尤其當回合數突破數百時,模型必須在每一步重新處理全部已學資訊。若缺乏足夠的上下文容量,代理只能參考有限的先前資訊,導致 能力受限,即使模型本身再先進,也難以發揮全效。

Tensor Parallelism(張量平行)在高互動場景的挑戰

為了在 3,000 令牌/秒以上的速率服務單一使用者,同時管理 100K 輸入 token 的 KV 快取(key‑value cache),系統必須克服 協調成本。張量平行將運算切分至多顆晶片,再合併結果;但在極小 batch size(即高互動性)下,頻繁的張量傳輸與同步開銷往往抵消分散運算的效益。Groq 3 LPX 透過緊密的硬體排程與低延遲互連,成功將這些開銷降至可接受範圍,從而在高互動性需求下仍保持卓越效能。

產業意義與未來展望

此一成果顯示,Vera Rubin 平台 已具備支援「AI 工廠」中多代理系統的基礎建設,能同時提供 高速輸出 與 長上下文記憶。對於需要即時回應且需追蹤大量歷史資訊的應用(如對話式客服、程式碼輔助、複雜決策支援),此技術將大幅提升使用者體驗。未來若能進一步優化張量平行的協調機制,或結合更高容量的 KV 快取,預計可在 千兆參數 級別的模型上重現相似的互動效能,為人工智慧應用開啟新一輪的規模與效能突破。

分享