
NVIDIA Dynamo‑Triton 支援生成式推薦系統 HSTU 推理工作流程
生成式推薦(Generative Recommender, GR) 正在成為大規模個人化的新趨勢。傳統的推薦系統將「檢索 → 排序 → 預測」拆成多個獨立階段,而 GR 則把整個流程重新定義為 序列建模:使用者的互動、情境、候選商品與動作全部被視為高基數(high‑cardinality)的事件串列,模型從這條串列中學習產生或評分下一個相關商品。
這種方法在 使用者歷史長、商品目錄頻繁變動、且需要捕捉豐富序列行為 的現代工作負載中特別有吸引力。但同時也帶來了服務端的挑戰:即使面對龐大的嵌入表(embedding tables)與以序列為主的模型架構,仍必須在 低延遲 的條件下完成推理。
Dynamo‑Triton 與 HSTU 的完整解決方案
NVIDIA 近期將 Dynamo‑Triton(前身為 Triton Inference Server) 與 Hierarchical Sequential Transduction Unit(HSTU) 結合,提供一條端到端的 GR 推理工作流程,相關程式碼皆收錄於 NVIDIA recsys‑examples 倉庫。此流程整合了:
| 元件 | 功能說明 | |------|----------| | HTSU | 針對高基數、非平穩(non‑stationary)事件串列設計的階層式序列轉換單元 | | PyTorch Ahead‑of‑Time Inductor(AOTI) | 事前編譯(ahead‑of‑time compile)模型,提升執行效率 | | FlexKV | GPU 支援的 KV 快取,減少重複計算 | | 原生 C++ 驗證 | 在 C++ 環境下驗證部署產物的正確性 | | NV embedding cache | 快速存取大型嵌入向量 | | Dynamo‑Triton 部署 | 無需改寫模型,即可在 Triton 上提供服務 |
實測效能
在 NVIDIA RTX PRO 6000 Blackwell 工作站版 GPU 上,以 動態批次大小 8 為例:
- 三層 HSTU 模型:相較於未使用 KV 快取的同樣 AOTI 配置,最高可達 4.47 倍 的速度提升。
- 八層 HSTU 模型:在 100% GPU KV‑cache 命中率下,提升幅度更大,最高達 5.93 倍。
這表示,透過 GPU‑backed KV 快取,可大幅降低推理延遲,對於需要即時回應的推薦服務具有實質價值。
從研發到上線的完整步驟
-
模型匯出與 AOTI 編譯:將 PyTorch 開發的 HSTU 模型導出,使用 AOTI 產生針對 GPU 最佳化的執行檔。
-
驗證:分別在 Python 與原生 C++ 環境下驗證編譯後的模型行為,確保與開發階段一致。
-
部署至 Dynamo‑Triton:將編譯產物與 FlexKV 快取設定一起上傳至 Triton,無需為不同執行時重新改寫模型程式碼。
-
效能測試:利用內建基準測試工具,觀測 KV‑cache 命中率與延遲之間的關係,證實最高可達 5.93 倍的延遲縮減。
未來展望與讀者啟示
HSTU 的設計讓 高基數、持續變動的事件流 能以單一序列模型處理,簡化了傳統推薦系統中多模型與特徵管線的複雜度。結合 Dynamo‑Triton、AOTI 與 FlexKV,業者不僅能在研發階段快速驗證模型,亦能在生產環境中以 低延遲、高吞吐 的方式提供服務。
對於關注 即時個人化、大規模嵌入表管理 以及 GPU 加速推理 的技術團隊而言,此工作流程提供了一條可直接套用的路徑。未來若能進一步提升 KV‑cache 的預測命中率,或結合更深層的 HSTU 結構,預計在千億級商品庫的場景下仍能維持毫秒級回應,為生成式推薦系統的商業化落地奠定堅實基礎。