
Alibaba는 2.4조 파라미터의 mixture-of-experts 모델인 Qwen3.8-2.4T-A95B의 오픈 웨이트를 공개했고, NVIDIA는 이를 자사의 랙 스케일 시스템인 GB300 NVL72 전반에서 실행하는 배포 경로를 발표했다. 이번 발표는 대규모 오픈 웨이트 모델을 장문맥 추론과 에이전틱 애플리케이션을 위해 설계된 하드웨어·소프트웨어 서빙 스택의 중심에 두었다.
이 모델은 매 요청마다 전체 파라미터 수를 사용하는 대신 토큰당 950억 개의 파라미터를 활성화한다. NVIDIA는 초기 FP8 배포가 GB300 NVL72에서 GPU당 초당 4,000토큰 이상, 사용자당 초당 350토큰 이상을 제공할 수 있다고 말하지만, 이 수치는 NVIDIA 자체 인프라 테스트 결과이므로 독립적인 벤치마크로 간주해서는 안 된다.
NVIDIA 기사에서 Qwen3.8-Max라고도 언급되는 Qwen3.8-2.4T-A95B는 코딩, 대규모 문서 분석, 다단계 에이전틱 워크로드를 위한 모델로 자리매김하고 있다. NVIDIA에 따르면 Alibaba의 공개를 통해 이 모델의 가중치는 Hugging Face와 ModelScope에서 제공된다.
아키텍처는 세밀한 mixture-of-experts 라우팅과 full-attention 및 linear-attention 층의 교차 구조를 결합한다. 학습된 라우터가 각 토큰에 필요한 전문가를 선택하므로, 모델의 서빙 비용은 전체 2.4T 파라미터 용량보다 실제 활성 파라미터에 더 밀접하게 좌우된다.
이 attention 설계는 에이전틱 시스템에서의 특정 문제를 다룬다. 문맥에는 여러 턴에 걸쳐 시스템 지시사항, 도구 결과, 검색한 문서, 소스 코드, 로그, 중간 추론이 누적될 수 있기 때문이다. NVIDIA는 이 모델이 최대 100만 토큰의 컨텍스트 윈도와 최대 128K 토큰의 출력을 지원한다고 말한다. linear-attention 층은 커져가는 key-value 캐시 대신 제한된 재귀 상태를 사용하며, full-attention 층은 필요할 때 더 넓은 토큰 간 상호작용을 유지한다.
이런 기능은 긴 워크플로 전반에서 상태를 유지해야 하는 에이전트를 만드는 제품팀에 중요하다. 또한 100만 토큰 컨텍스트는 병목을 순수한 모델 연산에서 메모리 용량, 통신, 캐시 관리로 옮겨갈 수 있어 실무적인 인프라 문제도 제기한다.
NVIDIA의 GB300 NVL72는 72개의 Blackwell Ultra GPU를 단일 랙 스케일 플랫폼에 통합한다. NVIDIA에 따르면 이 시스템은 72-GPU NVLink 도메인과 130 TB/s의 all-to-all 통신을 제공한다. 이러한 인터커넥트는 대규모 MoE 모델에서 중요하다. 기존 서버 네트워크를 통해 전문가 요청을 라우팅하면 통신 오버헤드와 불균등한 활용률이 발생할 수 있기 때문이다.
따라서 Qwen3.8-2.4T-A95B를 서빙하는 일은 단순히 모델 파일을 여러 가속기 위에 올려두는 것 이상을 요구한다. 배포에는 분산 실행, 최적화된 커널, 그리고 랙 전반의 전문가 트래픽을 조율할 수 있는 추론 런타임이 필요하다. NVIDIA의 블로그는 GB300 구성을 이러한 조율을 단순한 기본 네트워킹이 아니라 시스템 설계의 일부로 만드는 방법으로 제시한다.
NVIDIA는 보고된 Day 0 결과가 추가 모델 튜닝 없이 FP8에서 달성되었다고 말한다. 회사는 NVFP4 정밀도를 통해 추가 성능 향상을 기대하지만, 제공된 발표에는 향후 성능 수치가 제시되지 않았다. FP8 및 더 낮은 정밀도 실행은 메모리와 연산 요구를 줄일 수 있지만, 실제 구매자는 여전히 출력 품질, 수치 안정성, 그리고 전체 랙 스케일 배포의 운영 비용을 평가해야 한다.
주목할 만한 제품 기능은 Qwen3.8-2.4T-A95B에 내장된 추론 제어다. NVIDIA에 따르면 개발자는 요청별로 low, high, xhigh 추론 모드를 선택할 수 있다. 이 제어는 애플리케이션이 추론 깊이와 응답 품질, 지연 시간 사이에서 균형을 잡도록 하기 위한 것이다.
이는 추론을 고정된 전역 설정으로 보는 것보다 운영상 훨씬 유용하다. 모호한 아키텍처 문제를 다루는 코딩 에이전트는 더 높은 설정을 사용할 수 있고, 문서 처리 파이프라인은 처리량을 극대화하기 위해 추론 깊이를 낮출 수 있다. 엔터프라이즈 시스템에서는 이 선택이 작업 우선순위, 사용자 등급, 또는 애플리케이션의 지연 시간 예산과 연결될 수도 있다.
이 제어가 평가의 필요성을 없애지는 않는다. 팀은 더 높은 추론 설정이 추가 연산을 정당화할 만큼 작업 완료율을 개선하는지, 그리고 더 낮은 설정이 반복적 워크로드에서 정확도를 유지하는지를 측정해야 한다. 발표에는 세 가지 모드 간 품질 차이에 대한 독립적인 분석은 없다.
이 배포에 대한 주요 증거는 NVIDIA Developer Blog 게시물에서 나오며, 성능 수치, 시스템 설명, 서빙 권장 사항의 출처는 NVIDIA이다. 별도의 NVIDIA Developer 목록은 같은 발표를 가리키지만 독립적인 보도를 추가하지는 않는다. 제공된 소스 자료에는 제3자 벤치마크 결과, 고객 배포, 검증된 운영 채택이 포함되어 있지 않다.
NVIDIA는 서빙 성능을 제어하려는 개발자를 위한 오픈소스 추론 옵션으로 SGLang, vLLM, NVIDIA Dynamo를 제시한다. 또한 게시물에서 지원 모델을 제공할 수 있는 모델 프리 추론 컨테이너로 설명된 NVIDIA NIM도 제공한다. 의도된 워크플로는 모델 가중치를 다운로드한 뒤 컨테이너를 통해 배포하고 필요에 따라 서비스를 확장하는 것이다.
커스터마이징을 위해 NVIDIA는 NVIDIA NeMo AutoModel을 권장한다. PyTorch 네이티브 파인튜닝 라이브러리는 Hugging Face 체크포인트의 직접 사용, 완전한 지도 학습 파인튜닝, LoRA 기반 적응을 지원한다고 회사는 밝힌다. 이는 공개 체크포인트에서 도메인 특화 버전으로 가는 경로를 제공하지만, 모델 규모가 큰 만큼 학습, 체크포인트 저장, 평가는 여전히 상당한 인프라 프로젝트다.
“GPU당 초당 4K토큰 이상”과 “사용자당 초당 350토큰 이상” 수치는 특히 신중하게 해석해야 한다. NVIDIA는 이를 자사의 하드웨어·소프트웨어 스택에서 얻은 Day 0 결과라고 밝힌다. 이는 배포 레시피의 성능 목표를 보여주는 것이지, 다른 서버, 정밀도 설정, 배치 프로필, 애플리케이션 워크로드에 그대로 적용되는 보편적 결과가 아니다.
AI 빌더에게 이번 발표는 총 용량이 조 단위 파라미터로 측정되면서도 토큰당 활성화는 더 낮은 모델로 향하는 오픈 웨이트 설계 공간을 넓힌다. 이는 밀집형 2.4T 모델이 매 토큰마다 모든 파라미터를 실행하지 않고도 특화된 추론과 에이전틱 행동을 지원할 수 있음을 뜻한다.
하지만 하드웨어 장벽은 높다. 72-GPU 랙 스케일 플랫폼은 일반적인 개발 환경이 아니며, 팀은 토큰당 처리량 수치와 함께 활용률, 스케줄링, 모델 복제, 장애 복구, 전력 비용을 고려해야 한다. 모델은 기술적으로는 개방되어 있지만, 광고된 규모로 운영하는 일은 고급 인프라에 접근 가능한 자금력 있는 기업, 클라우드 제공업체, 연구 조직에 집중될 가능성이 높다.
이 배포는 모델의 개방성과 운영상의 접근성 사이에 커지는 격차도 보여준다. 오픈 웨이트는 실험과 파인튜닝을 가능하게 하지만, 장문맥 서빙과 대규모 MoE 통신은 여전히 특수 시스템에 의존한다. 모델을 평가하는 구매자는 단순한 생성 속도보다 작업 완료당 엔드투엔드 비용을 비교해야 한다. 또한 도구 사용, 장문맥 검색, 다단계 실행에서의 신뢰성, 서로 다른 추론 설정에서의 행동도 테스트해야 한다.
가장 명확한 후속 신호는 SGLang, vLLM, NVIDIA Dynamo 전반에서 Qwen3.8-2.4T-A95B를 독립적으로 테스트하는 것이다. 여기에는 각 추론 수준에서의 지연 시간, 처리량, 메모리 사용량, 품질이 포함돼야 한다. 다른 오픈 웨이트 모델과의 비교를 통해 이 아키텍처가 파라미터 수를 넘어서는 실질적 이점을 제공하는지 알 수 있다.
개발자들은 또한 약속된 NVFP4 최적화, 추가 배포 레시피, 실제 운영 워크로드에서의 증거를 주시해야 한다. 모델 가중치, 파인튜닝된 체크포인트, 장문맥 에이전틱 애플리케이션의 채택이 단순 다운로드 수보다 더 의미 있다. 마지막으로 GB300 NVL72 시스템의 비용과 가용성이 이것이 주로 랙 스케일 인프라의 쇼케이스로 남을지, 아니면 널리 활용 가능한 서빙 옵션이 될지를 결정할 것이다.
NVIDIA의 발표가 중요한 이유는 2.4T 파라미터 모델을 보편적으로 접근 가능하게 만들었기 때문이 아니라, 오픈 웨이트, MoE 라우팅, 설정 가능한 추론, 랙 스케일 인터커넥트가 어떻게 함께 설계되고 있는지를 보여주기 때문이다. 이 배포는 추론을 시스템 문제로 다루며, 통신과 메모리를 가속기 연산만큼 중요하게 본다.
제품팀에게 중요한 질문은 가장 큰 모델이 토큰을 빠르게 생성할 수 있는지가 아니다. 중요한 것은 그 추론 제어와 장문맥 아키텍처가 특정 워크플로를 특수 인프라를 정당화할 만큼 개선하는지 여부다. 독립적인 벤치마크와 운영 증거가 나오기 전까지 Qwen3.8-2.4T-A95B는 엔터프라이즈 배포의 검증된 기본값이라기보다, 벤더가 보고한 서빙 청사진과 결합된 유망한 오픈 모델로 보는 것이 가장 적절하다.
NVIDIA는 Alibaba의 오픈 웨이트 Qwen3.8 모델이 GB300 NVL72에서 어떻게 구동되는지 설명하며, 대규모 에이전틱 워크로드를 위한 설정 가능한 추론 기능을 제시했다.