英偉達 cuML 與 cuVS 以 8 分鐘處理 870 GB 向量,加速 UMAP 計算
AI 奇點前沿

英偉達 cuML 與 cuVS 以 8 分鐘處理 870 GB 向量,加速 UMAP 計算

AI News Bot
2026-08-19
Photo by Nana Dua on Pexels
預計閱讀 1 分鐘原文來源

英偉達 cuML 與 cuVS 以 8 分鐘處理 870 GB 向量,加速 UMAP 計算

**Uniform Manifold Approximation and Projection(UMAP)**是目前廣泛使用的降維技術,常被應用於探索性資料分析、主題模型與單細胞基因分析等領域。UMAP 需要先為每筆向量建立 k 最近鄰(kNN)全域圖,此步驟在資料規模達到數億筆向量時,會成為計算瓶頸,導致互動式探索變得緩慢甚至不可行。

多 GPU 重新設計的關鍵概念

在先前的 Even Faster and More Scalable UMAP on the GPU with NVIDIA cuML 文章中,英偉達已示範 out‑of‑core(超出記憶體)方式:將資料切割成平衡的叢集,並在相鄰叢集之間保留重疊向量,以維持跨叢集的最近鄰關係。每個叢集的局部 kNN 圖可獨立計算,最後再合併成全域圖,讓單張 GPU 即可處理原本無法放入記憶體的巨量資料。

cuML 25.06 與 cuVS 25.06 進一步將這一流程擴展至 多 GPU。因為每個叢集的運算不需要存取完整資料集,系統可以將不同叢集分派給不同 GPU 同時執行,從而將原本受限於單 GPU 的訓練階段,完整平行化。實測顯示,使用多張 GPU 同時建構全域 kNN 圖,能在 8 分鐘內完成 870 GB(約 1.2 億向量) 的 UMAP 訓練,較傳統單 GPU 方案快上數十倍,將原本需要數小時甚至數天的工作壓縮至分鐘等級。

對產業與研究的衝擊

  1. 互動式探索更即時:資料科學家在調整 UMAP 超參數或進行迭代分析時,無需長時間等待,即可即時觀察投影結果。

  2. 成本效益提升:以往為了處理百億規模向量,往往需要部署多台伺服器或使用雲端大型叢集;現在只要數張高階 GPU,即可在本地端完成。

  3. 保持嵌入品質:即使採用了分叢集與重疊策略,最終合併的全域圖仍保留原始資料的鄰近關係,嵌入結果與傳統全記憶體方法相當。

未來展望

隨著 cuML、cuVS 持續優化多 GPU 資料管線,未來有望支援更大規模(數百 GB 以上)的即時降維,甚至將 UMAP 與其他圖形演算法(如 HDBSCAN)串聯,形成完整的高維資料分析工作流。對於需要處理海量向量的領域——如推薦系統、基因組學與自然語言處理——此一突破將大幅縮短研發週期,讓資料驅動的創新更具即時性與可擴展性。

分享