NVIDIA 發布為放射科醫師式推理打造的開源 3D CT 模型

NVIDIA 發布了 NV-Reason-CT,一款開源 3D CT 視覺語言模型,旨在生成放射學報告、推理軌跡與後續對話。

AI News

NVIDIA 發布了 NV-Reason-CT,這是一款開源研究模型,旨在分析完整的三維 CT 檢查,而不是把它們當作彼此分離的 2D 圖像處理。公司表示,這款視覺語言模型可以生成結構化報告、透過類似放射科醫師的推理軌跡解釋發現,並支援胸部與腹部掃描的後續提問。

這次發布針對醫療 AI 的一個特定弱點:CT 檢查可能包含數百張切片,而其診斷意義取決於整個體積中的空間連續性。NVIDIA 將 NV-Reason-CT 視為研究人員與開發者建立專用應用的基礎,而不是自主診斷系統或已核准的臨床產品。

為體積影像設計的模型

一個典型的腹部 CT 檢查可能包含 300 到 600 張軸位切片。NVIDIA 認為,若將這些切片獨立處理,可能會掩蓋腫塊、積液與浸潤等發現的三維形狀、範圍與密度。NV-Reason-CT 則使用完整的 3D 視覺 Transformer 編碼器,將檢查作為一個體積來處理。

該模型將此編碼器與 Qwen3.5-4B 語言模型結合。NVIDIA 表示,編碼器改自 Primus 3D ViT,並在端到端重新訓練之前以 Colipri 權重初始化。CT 體積會被重新取樣為 192 立方體素輸入、2 毫米各向同性解析度,切分為不重疊的 8x8x8 區塊,並表示為 13,824 個視覺 tokens。

這些 tokens 會連同其三維網格座標一起傳入語言模型。NVIDIA 表示,旋轉位置編碼的 3D 版本,也就是 3D MRoPE,有助於語言模型考慮 tokens 之間的空間關係。這項設計旨在保留跨切面的解剖結構,並支援對多張切片的形態學推理。

報告、推理與後續對話

根據 NVIDIA,NV-Reason-CT 經過訓練,可產生結構化診斷報告,涵蓋一套包含 30 項胸部異常與 29 項腹部異常的 CT 本體。公司列舉的例子包括肺結節、氣胸、肝臟病灶與腎囊腫。

該系統也被設計成可生成 NVIDIA 所描述、類似放射科醫師系統性檢閱的 chain-of-thought 推理。它可以依照解剖區域前進,記錄相關的正常與異常發現,考慮鑑別診斷,並在得出結構化結論前表達不確定性。

這項能力對模型的預期用途很重要,但需要審慎解讀。推理輸出是模型生成的說明,不是系統已重現臨床判斷的證據,也不代表每個中間陳述都可靠。對開發者而言,實際價值在於輸出可以被檢視、質疑,並作為評估的起點,而不只是得到一個不透明的分類結果。

NVIDIA 也表示,使用者可以針對發現提出多步驟後續問題、要求釐清鑑別診斷,並探查模型的推理。這使 NV-Reason-CT 在其提議的工作流程中不只是一次性報告產生器,不過公司在提供的材料中並未證明這種對話行為已準備好用於無監督的臨床部署。

效能宣稱仍來自供應商報告

NVIDIA 報告稱,NV-Reason-CT 在 CT-RATE 基準上取得 Macro-F1 0.614 與 Macro-AUROC 0.871。公司將這些結果描述為最先進,並表示該模型優於已發表的 3D 對比式與融合 2D/3D 基準模型。

這些說法來自 NVIDIA 的開發者部落格,也就是本報導的主要來源。現有資料無法獨立驗證基準設定、資料集組成、統計不確定性或精確的比較系統。因此,在能透過發布材料、同儕審查或獨立重現來評估方法與結果之前,應將基準表現視為供應商報告的成果。

NVIDIA 也表示,美國國家衛生研究院的放射科醫師評估了模型結構化報告與推理軌跡的臨床合理性。公司將此回饋視為支持模型的可稽核性與可信度,但提供的材料未說明評估者人數、評估流程、錯誤率,或是否衡量臨床結果。

該部落格將 NV-Reason-CT 放在更廣泛的 NVIDIA 醫療 AI 生態系中,並與公司早先的 NV-Reason-CXR 方法論相連結。NVIDIA 表示,該方法已在 RSNA 2026 接受的一項多讀者臨床研究中獲得驗證,包括在維持診斷準確度的同時節省放射科醫師時間。這項結果關於胸部 X 光模型,並不能證明 NV-Reason-CT 具有同等表現。

為何這次發布對 AI 開發者重要

對醫療 AI 團隊而言,主要機會不是立即取代放射科醫師,而是取得一個開放研究基礎,能進一步針對更窄的 CT 任務進行後訓練,例如器官特定分流、結構化文件撰寫,或在明確臨床工作流程中的問答。

這項架構也反映了部署上的權衡。將 13,824 個視覺 tokens 與其空間座標送入語言模型,雖可保留切片式系統會丟棄的資訊,但也對記憶體、延遲與基礎設施提出相當高的需求。團隊需要衡量推理成本、吞吐量、上下文處理,以及在他們關心的掃描器、協定與病患族群上的表現。

推理介面可支援稽核工作流程、資料集審查與人機互動,特別是當產品團隊需要系統說明其檢查了哪些解剖區域時。不過,明顯可見的推理並不能消除基於事實的評估需求。看似合理的敘述仍可能包含遺漏的發現、錯誤的鑑別診斷或缺乏依據的自信,因此校準與切片層級或區域層級驗證仍然不可或缺。

對企業買家而言,這次發布最好被理解為開發元件,而非可直接部署的臨床產品。法規核准、本地驗證、資料治理、與影像儲存與傳輸系統的整合,以及最終解讀責任的清楚界定,仍然是彼此獨立的要求。

接下來要觀察什麼

第一個訊號將是 NVIDIA 開源發布的完整性:模型權重、授權條款、訓練細節、評估腳本,以及關於允許醫療用途的文件。這些細節將決定外部團隊是否能重現所報告的 CT-RATE 結果,或有意義地調整模型。

研究人員也應關注跨不同掃描儀、採集協定、機構以及代表性不足病患族群的獨立測試。對罕見異常、偶發發現、雜訊較多的研究與不完整檢查的表現,會比單一整體基準更能反映實際部署價值。

還需要更多證據來說明對話可靠性。後續問題可以揭示模型是否持續指向正確區域與先前發現,或只是產生流暢但脫節的回答。NVIDIA 與互補的分割與合成資料模型整合的方式,也可能顯示 NV-Reason-CT 是否會成為實際開發流程的一部分,而不只是獨立研究示範。

Creati.ai 觀點

NV-Reason-CT 值得注意,因為它將 3D 表徵、報告結構與互動視為同一個設計問題。NVIDIA 不只是把通用視覺語言模型套用到一疊醫療影像上;它是把體積連續性放在架構與訓練目標的核心。

即便如此,這次發布仍應被視為開放研究基礎,而不是僅憑供應商基準就能成立的臨床突破。其長期價值將取決於可重現性、錯誤分析、運算需求,以及獨立醫療團隊是否能將模型的推理介面轉化為更安全、可衡量的工作流程。

廣告