Build Local AI Apps with C++ and NVIDIA TensorRT RTX Samples

Build Local AI Apps with C++ and NVIDIA TensorRT RTX Samples

AI News Bot
2026-10-03
預計閱讀 1 分鐘原文來源

建構本地 AI 應用:C++ 與 NVIDIA TensorRT RTX 範例

在把 AI 模型嵌入本地程式時,可移植的模型格式、可靠的執行時環境以及跨平台的加速支援缺一不可。
Do Inference Now (DIN) Deploy 以開源 C++ 範例彌合這三者的落差,結合 ONNX Runtime(開放式神經網路交換格式執行時)與 NVIDIA TensorRT RTX 執行提供者,讓開發者能從模型檢查點(checkpoint)直接產出在 Windows 與 Linux 上具硬體加速的原生應用。相同的 ONNX Runtime API 亦可透過 WinML 2.0 在 Windows 上呼叫。

範例工作流程

每個 DIN Deploy 範例皆先以 Python 匯出程式下載 Hugging Face 上的模型檢查點,並 轉換 成 ONNX 檔案(中立的模型表示)。接著,C++ 命令列介面(CLI)以 ONNX Runtime 為核心載入模型,執行推論。這樣的「模型轉換」與「部署邏輯」分離,使得開發者不必為每個模型維護專屬的執行時。

在 C++ 程式碼中,主要使用 ONNX Runtime 的 session(會話)與 tensor(張量)API。僅在需要加速時,才加入 CUDA API 或自訂 kernel 的可選路徑;只要執行提供者(如 TensorRT)支援相同的張量 API,即可共享大部分程式碼。ONNX Runtime 的 copy tensor API 亦確保資料局部性,避免在共享程式碼中直接呼叫供應商專屬函式。

特色範例與效能

  • FLUX.2:示範使用 ONNX Runtime 1.25 版的圖形互操作(Vulkan、DirectX)進行前後處理,支援即時影像取樣。
  • 語音辨識(ASR):提供離線與串流兩種管線。OpenAI Whisper 處理離線文字轉寫;NVIDIA Parakeet TDT 與 Nemotron ASR Streaming 則支援即時串流。
  • Meta SAM 2.1:支援影像與影片的互動遮罩,產生分割遮罩供本地應用進行選取、追蹤等電腦視覺工作。
  • FLUX.2‑klein‑4B:示範以提示驅動的圖像生成,結合 Vulkan/DirectX 圖形 API 互操作,並展示使用 NVIDIA Model Optimizer 進行 後訓練量化(PTQ),產生量化 ONNX 模型。量化模型在介面上與原始模型相同,僅需替換檔案即可享受更低記憶體與更高效能,無需修改程式碼。

表 1(原文)列出在 DGX Spark 上執行的 GPU 與 CPU 效能比較,顯示加速後的推論速度可提升數十倍。

建置與未來展望

開發者可直接使用倉庫提供的 CMake preset,支援 Windows、Linux、x86‑64 與 Arm64(含 ARM64 變體),其中 DirectX 僅限 Windows 平台。完成設定與編譯後,即可匯出模型至 ONNX,並以 CLI 搭配 TensorRT 執行。

DIN Deploy 的模組化設計讓 本地 AI 應用 從概念驗證快速躍升至產業級部署。未來,隨著 ONNX Runtime 持續擴充執行提供者與圖形互操作支援,開發者將能更輕鬆地在多元硬體(包括嵌入式與邊緣裝置)上部署高效能 AI,實現即時影像、語音與文字處理的全端解決方案。

分享