NVIDIA, 방사선과 의사식 추론을 위한 오픈 3D CT 모델 공개

NVIDIA는 방사선 보고서, 추론 흔적, 후속 대화를 생성하도록 설계된 오픈 3D CT 비전-언어 모델 NV-Reason-CT를 공개했다.

AI News

NVIDIA는 분리된 2D 이미지로 취급하지 않고 완전한 3차원 CT 검사를 분석하도록 설계된 오픈 연구 모델 NV-Reason-CT를 공개했다. 회사는 이 비전-언어 모델이 구조화된 보고서를 생성하고, 방사선과 의사식 추론 흔적으로 소견을 설명하며, 흉부 및 복부 스캔에 대한 후속 질문을 지원할 수 있다고 밝혔다.

이번 공개는 의료 AI의 특정한 약점을 겨냥한다. CT 검사는 수백 개의 슬라이스를 포함할 수 있으며, 그 진단적 의미는 볼륨 전체에 걸친 공간적 연속성에 달려 있다. NVIDIA는 NV-Reason-CT를 자율 진단 시스템이나 승인을 받은 임상 제품이 아니라, 특화된 애플리케이션을 구축하는 연구자와 개발자를 위한 기반으로 제시하고 있다.

체적 영상용으로 설계된 모델

일반적인 복부 CT 검사는 300~600개의 축상 슬라이스를 포함할 수 있다. NVIDIA는 이러한 슬라이스를 개별적으로 처리하면 종괴, 삼출액, 침윤과 같은 소견의 3차원 형태, 범위, 밀도를 가릴 수 있다고 주장한다. NV-Reason-CT는 대신 완전한 3D 비전 트랜스포머 인코더를 사용해 검사를 하나의 볼륨으로 처리한다.

이 모델은 해당 인코더와 Qwen3.5-4B 언어 모델을 결합한다. NVIDIA에 따르면 인코더는 Primus 3D ViT에서 조정되었고, 엔드투엔드 재학습 전에 Colipri 가중치로 초기화되었다. CT 볼륨은 2밀리미터 등방 해상도의 192 입방 보셀 입력으로 재샘플링되고, 겹치지 않는 8x8x8 패치로 나뉘며, 13,824개의 비전 토큰으로 표현된다.

이 토큰들은 3차원 그리드 좌표와 함께 언어 모델에 전달된다. NVIDIA는 회전 위치 임베딩의 3D 버전인 3D MRoPE가 언어 모델이 토큰 간의 공간적 관계를 고려하는 데 도움이 된다고 설명한다. 이 설계는 평면을 가로지르는 해부학적 구조를 보존하고 여러 슬라이스에 걸친 형태학적 추론을 지원하는 것을 목표로 한다.

보고서, 추론, 후속 대화

NVIDIA에 따르면 NV-Reason-CT는 30개의 흉부 이상과 29개의 복부 이상을 포함하는 CT 온톨로지를 다루는 구조화된 진단 보고서를 생성하도록 훈련되었다. 회사가 예로 든 항목에는 폐결절, 기흉, 간 병변, 신낭종이 포함된다.

이 시스템은 또한 방사선과 의사의 체계적 검토를 닮은 체인-오브-소트 추론을 생성하도록 설계되었다고 NVIDIA는 설명한다. 해부학적 영역을 따라 이동하고, 관련 정상 및 비정상 소견을 기록하며, 감별진단을 고려하고, 구조화된 결론에 도달하기 전에 불확실성을 표현할 수 있다.

이 기능은 모델의 의도된 사용에 중요하지만, 신중한 해석이 필요하다. 추론 출력은 모델이 생성한 설명일 뿐, 시스템이 임상적 판단을 재현했다는 증거도 아니고 모든 중간 진술이 신뢰할 수 있다는 뜻도 아니다. 개발자에게 중요한 점은 이 출력을 살펴보고, 이의를 제기하고, 평가의 출발점으로 사용할 수 있다는 것이며, 불투명한 분류만 받는 것이 아니라는 점이다.

NVIDIA는 또한 사용자가 소견에 대해 단계별 후속 질문을 하고, 감별진단의 명확화를 요청하며, 모델의 추론을 검증할 수 있다고 밝혔다. 이는 제안된 워크플로에서 NV-Reason-CT가 단순한 일회성 보고서 생성기 이상임을 의미하지만, 제공된 자료에는 대화형 동작이 비감독 임상 배포에 적합하다는 증거가 제시되어 있지 않다.

성능 주장은 여전히 벤더 보고에 머문다

NVIDIA는 NV-Reason-CT가 CT-RATE 벤치마크에서 Macro-F1 0.614와 Macro-AUROC 0.871을 기록했다고 보고한다. 회사는 이를 SOTA라고 설명하며, 공개된 3D 대비 학습 및 2D/3D 융합 기반선보다 우수했다고 말한다.

이는 본 보도의 주요 출처인 NVIDIA 개발자 블로그의 주장이다. 현재 उपलब्ध 자료만으로는 벤치마크 설정, 데이터셋 구성, 통계적 불확실성, 정확한 비교 시스템을 독립적으로 검증할 수 없다. 따라서 방법론과 결과가 릴리스 자료, 동료 검토, 또는 독립 재현을 통해 평가되기 전까지는 벤치마크 성능을 벤더 보고 결과로 간주해야 한다.

NVIDIA는 또한 미국 국립보건원(National Institutes of Health)의 방사선과 의사들이 모델의 구조화된 보고서와 추론 흔적의 임상적 타당성을 평가했다고 밝힌다. 회사는 이 피드백을 모델의 감사 가능성과 신뢰성을 뒷받침하는 것으로 제시하지만, 제공된 자료에는 평가자 수, 평가 프로토콜, 오류율, 혹은 임상 결과를 측정했는지가 명시되어 있지 않다.

이 블로그는 NV-Reason-CT를 NVIDIA의 더 넓은 의료 AI 생태계 안에 두고, 회사의 이전 NV-Reason-CXR 방법론과 연결한다. NVIDIA는 이 접근법이 RSNA 2026에서 채택된 다중 판독자 임상 연구에서 검증되었으며, 진단 정확도를 유지하면서 방사선과 의사의 시간을 절약했다고 말한다. 이 결과는 흉부 X-ray 모델에 관한 것이며, NV-Reason-CT에 동등한 성능을 입증하는 것은 아니다.

이번 공개가 AI 개발자에게 중요한 이유

의료 AI 팀에게 가장 중요한 기회는 방사선과 의사를 즉시 대체하는 것이 아니다. 장기별 트리아지, 구조화된 문서화, 정의된 임상 워크플로에서의 질의응답처럼 더 좁은 CT 작업을 위해 추가 학습할 수 있는 오픈 연구 기반에 접근하는 것이다.

이 아키텍처는 배포상의 절충도 드러낸다. 13,824개의 시각 토큰과 그 공간 좌표를 언어 모델에 전달하면 슬라이스 기반 시스템이 버리는 정보를 보존할 수 있지만, 메모리, 지연 시간, 인프라에 상당한 요구를 만든다. 팀은 자신들에게 중요한 스캐너, 프로토콜, 환자 집단에서 추론 비용, 처리량, 컨텍스트 처리, 성능을 측정해야 한다.

추론 인터페이스는 감사 워크플로, 데이터셋 검토, 인간-AI 상호작용을 지원할 수 있다. 특히 제품 팀이 시스템에 어떤 해부학적 영역을 검토했는지 설명하게 해야 할 때 유용하다. 그러나 보이는 추론이 근거 있는 평가의 필요성을 없애지는 못한다. 그럴듯한 서술에도 놓친 소견, 잘못된 감별진단, 뒷받침되지 않는 확신이 포함될 수 있으므로, 보정과 슬라이스 수준 또는 영역 수준 검증이 필수적이다.

기업 구매자에게 이번 공개는 배포 가능한 임상 제품이라기보다 개발 구성 요소로 이해하는 것이 적절하다. 규제 승인, 로컬 검증, 데이터 거버넌스, PACS와의 통합, 최종 해석에 대한 명확한 책임은 별도의 요구 사항으로 남아 있다.

다음에 주목할 점

첫 번째 신호는 NVIDIA의 오픈 릴리스가 얼마나 완전한가 하는 점이다. 모델 가중치, 라이선스 조건, 학습 세부 사항, 평가 스크립트, 허용된 의료 사용에 대한 문서가 포함되는지가 중요하다. 이러한 세부 정보가 외부 팀이 보고된 CT-RATE 결과를 재현하거나 모델을 의미 있게 조정할 수 있는지를 결정한다.

연구자들은 서로 다른 스캐너, 획득 프로토콜, 기관, 그리고 대표성이 낮은 환자 집단 전반에서의 독립적인 테스트도 지켜봐야 한다. 드문 이상 소견, 우연 발견, 노이즈가 많은 검사, 불완전한 검사에서의 성능은 단일 종합 벤치마크보다 배포에 더 유용한 정보를 제공할 것이다.

대화 신뢰성에 대한 추가 증거도 필요하다. 후속 질문은 모델이 올바른 부위와 이전 소견을 일관되게 참조하는지, 아니면 유창하지만 연결되지 않은 답변을 생성하는지를 드러낼 수 있다. NVIDIA가 보완적인 분할 및 합성 데이터 모델과 통합하는 방식도 NV-Reason-CT가 독립적 연구 시연에 머무르지 않고 실제 개발 파이프라인의 일부가 되는지를 보여줄 수 있다.

Creati.ai 관점

NV-Reason-CT가 주목받는 이유는 3D 표현, 보고서 구조, 상호작용을 하나의 설계 문제로 다루기 때문이다. NVIDIA는 범용 비전-언어 모델을 의료 이미지 묶음에 단순히 적용하는 것이 아니라, 체적 연속성을 아키텍처와 학습 목표의 중심에 둔다.

그럼에도 이 공개는 벤더 벤치마크만을 근거로 한 임상적 돌파구가 아니라 오픈 연구 기반으로 평가되어야 한다. 장기적 가치는 재현성, 오류 분석, 연산 요구 사항, 그리고 독립적인 의료 팀이 모델의 추론 인터페이스를 더 안전하고 측정 가능한 워크플로로 전환할 수 있는지에 달려 있다.

광고