英偉達推出 NV‑Reason‑CT:專為 3D CT 影像設計的視覺語言模型
AI 奇點前沿

英偉達推出 NV‑Reason‑CT:專為 3D CT 影像設計的視覺語言模型

AI News Bot
2026-09-25
預計閱讀 1 分鐘原文來源

核心亮點

NV‑Reason‑CT 是英偉達(NVIDIA)首款專為 3D CT 影像設計的視覺語言模型(Vision‑Language Model, VLM),可在完整體積資料上執行「思考鏈」推理,產出結構化診斷報告,並支援胸部與腹部多步驟對話。模型以 Qwen3.5‑4B 大型語言模型結合 3D ViT(視覺轉換器)編碼器,全部權重端對端再訓練,定位於研究與開發基礎,而非已獲批准的臨床診斷系統。

背景與挑戰

過去的放射 AI 主要聚焦於胸部 X 光、病理切片與 2D 影像,對資料密集且三維結構豐富的 CT(電腦斷層)仍缺乏有效支援。傳統 2D 編碼器只能將每片切片獨立處理,無法保留切片間的空間連續性,導致對體積病變的感知與推理受限。單一腹部 CT 研究常含 300‑600 片軸向切片,僅靠 2D 模型難以重建完整解剖上下文。

技術細節

  • 3D ViT 編碼器:採用 Primus/Colipri 架構,先以 Colipri 權重初始化,再於 192³ 體素(等距 2 mm)之 CT 體積上進行訓練。影像被切分為不重疊的 8×8×8 立方體 patch,產生 24×24×24=13,824 個視覺 token,全部傳入語言模型。
  • 思考鏈推理:模型學習模仿放射科醫師的逐層分析流程,從解剖定位、病變辨識到診斷結論,形成可追溯的推理軌跡。
  • 多步驟 VQA(視覺問答):內建對話機制,允許使用者在同一 CT 體積上提出連續問題,模型可依先前回應調整後續答案,提升臨床驗證的可信度。
  • 臨床驗證:延續 NV‑Reason‑CXR 的方法學,在 RSNA 2026 接受的多讀者臨床研究中證實,使用此模型可節省放射科醫師時間,同時維持診斷準確度。

影響與未來展望

NV‑Reason‑CT 為醫學影像 AI 開啟「全卷積」視覺語言模型的先例,讓研究人員能在真實三維資料上構建更具臨床價值的應用。未來若結合特定臟器或疾病的後訓練(fine‑tuning),有望產生針對肺部結節、肝臟腫瘤等領域的專屬輔助工具。儘管目前仍屬開放式研發平台,英偉達的此舉已為醫學影像 AI 從 2D 向 3D 轉型奠定基礎,期待產業與學術界共同探索更安全、可解釋的診斷支援方案。

分享