NVIDIA, Vera Rubin NVL72가 와트당 최대 30배 더 많은 에이전틱 AI 작업을 제공한다고 주장

NVIDIA는 Vera Rubin NVL72가 GB300보다 메가와트당 최대 30배 더 높은 에이전틱 AI 처리량을 제공할 수 있어 추론 경제를 바꿀 수 있다고 말합니다.

AI News

NVIDIA는 곧 출시될 Vera Rubin NVL72 플랫폼이 이전 제품인 GB300 NVL72보다 메가와트당 최대 30배의 에이전틱 AI 처리량을 제공할 수 있다고 말합니다. 이 주장은 고정 길이의 챗봇 프롬프트가 아니라 실제 생산 환경에 가까운 코딩 에이전트 세션을 재현하도록 설계된 벤치마크 SemiAnalysis AgentX의 초기 결과에서 나온 것입니다.

이 결과가 중요한 이유는 AI 에이전트가 기존 채팅보다 훨씬 더 많은 추론 트래픽을 생성하기 때문입니다. NVIDIA는 OpenRouter 데이터를 인용해, 에이전틱 요청 하나가 단순한 채팅 상호작용보다 약 15배 많은 토큰을 소비한다고 밝힙니다. 에이전트는 반복적으로 추론하고, 도구를 호출하고, 하위 에이전트에게 작업을 위임하며, 각 단계마다 확장되는 컨텍스트를 유지하기 때문에 계산 자원과 전력 예산 모두에 압박을 줍니다.

NVIDIA의 결과는 공급업체가 보고한 것이며 아직 SemiAnalysis의 검토를 기다리고 있습니다. 따라서 이는 Rubin에 대한 회사의 성능 목표를 나타낼 뿐, 독립적으로 확인된 업계 순위는 아닙니다. 그럼에도 이 벤치마크의 선택은 다단계 워크로드가 실제 운영에 들어가면서 인프라 제공업체가 AI 시스템을 측정하는 방식이 더 넓게 바뀌고 있음을 보여줍니다.

실제 에이전트 행동을 중심으로 만든 벤치마크

SemiAnalysis의 InferenceX 벤치마크 제품군의 일부인 AgentX 워크로드는 모델의 추론과 도구 사용이 교차하는 기록된 Claude Code 세션을 재생합니다. NVIDIA Developer Blog 자료에 따르면, 원래의 시퀀스 길이, 컨텍스트 증가, 추론 간격, 도구 호출 지연이 유지됩니다.

이 설계는 고정된 입력 및 출력 크기를 기준으로 하는 전통적인 추론 테스트와 다릅니다. 에이전트 세션에서는 시스템이 조사, 코드, 도구 결과, 위임된 작업을 축적하면서 프롬프트가 수천 토큰에서 수십만 토큰까지 확장될 수 있습니다. 이전에 처리한 컨텍스트는 키-값 캐시를 통해 재사용될 수도 있으며, 도구 실행은 모델 호출 사이에 공백을 만듭니다.

AgentX는 동시성을 다양하게 조정하고, 첫 토큰까지의 시간, 엔드투엔드 지연 시간, 사용자당 초당 토큰 수와 같은 상호작용성 지표에 대해 처리량을 평가합니다. NVIDIA는 Rubin의 대표 결과가 AgentX DeepSeek V4 Pro 워크로드에서 사용자당 초당 160토큰으로 측정되었다고 말합니다. 이 운영 지점에서 회사는 GB300 NVL72보다 메가와트당 최대 30배 높은 처리량을 보고합니다.

이 비교는 모든 모델이나 배포에 대한 일반적 진술이 아닙니다. 인용된 결과는 특정 플랫폼 구성, 워크로드, 상호작용 목표에 연결되어 있습니다. NVIDIA는 또한 이 측정에 아직 도구 호출을 위한 Vera CPU 성능이 포함되지 않아, 엔드투엔드 에이전트 시스템의 일부가 보고 수치 밖에 남아 있다고 말합니다.

NVIDIA가 추론 스택에서 바꾸고 있는 것

NVIDIA는 이 결과를 Rubin GPU 자체만이 아니라 하드웨어, 네트워킹, 소프트웨어의 조합 덕분이라고 설명합니다. NVL72 설계는 6세대 NVLink 및 NVLink Switch 시스템을 통해 GPU가 고대역폭·저지연 통신을 공유하는 대규모 스케일업 도메인을 만듭니다.

이 토폴로지는 장문맥 및 mixture-of-experts 워크로드를 위한 기술을 지원합니다. NVIDIA는 분산 KV 캐싱을 강조하는데, 이는 이전에 처리한 컨텍스트를 GPU 전반에서 사용할 수 있게 유지합니다. 또한 KV-aware routing은 관련 캐시 데이터를 이미 보유한 하드웨어로 요청을 보낼 수 있습니다. 분리형 서빙은 컨텍스트를 처리하는 prefill과 응답을 생성하는 decode를 분리하여 각 단계를 독립적으로 확장할 수 있게 합니다.

소프트웨어 계층에는 NVIDIA TensorRT-LLM, NVIDIA Dynamo, 그리고 GPU 간 통신과 계산을 결합하도록 설계된 CUDA 커널이 포함됩니다. 회사는 또한 NVFP4 양자화와 더 최신의 Tensor Core 및 Transformer Engine 기능을 메모리 사용량을 줄이고 토큰 처리량을 높이는 방법으로 제시합니다.

NVIDIA의 DSX MaxLPS 전력 관리 기술도 또 다른 수단으로 제시됩니다. 회사는 GPU, 랙, 워크로드 수준에서 전력을 관리함으로써 동일한 메가와트 예산 내에서 최대 40% 더 많은 GPU를 배치할 수 있다고 말합니다. NVIDIA는 별도로 Rubin이 인용된 워크로드에서 GB300 NVL72 대비 100만 토큰당 비용을 최대 35배까지 줄일 수 있다고 주장합니다.

증거, 비교, 한계

같은 AgentX 데이터는 NVIDIA의 세대별 성능 향상을 더 점진적으로 보여줍니다. NVIDIA는 GB300 NVL72가 DeepSeek V4 Pro 1.6T에서 H200 NVL8보다 메가와트당 처리량이 최대 15배 높고, 더 큰 Kimi K3 2.8T 모델에서는 최대 80배라고 보고합니다. 또한 인용된 비교에서 GB300이 H200보다 100만 토큰당 비용을 최대 10배 낮출 수 있다고 주장합니다.

이 수치들 역시 NVIDIA가 SemiAnalysis 워크로드를 사용해 제시한 것입니다. 기본 벤치마크는 동일한 트래픽을 재생해 비교를 더 현실적으로 만들려는 목적이지만, Rubin 측정값은 아직 NVIDIA 게시물에서 언급한 독립 검토를 받지 않았습니다. 따라서 독자는 벤치마크 방법론과 그로부터 보고된 성능 수치를 구분해야 합니다.

또한 이 주장들이 모든 에이전트 워크로드가 30배 향상을 얻는다는 것을 의미하지는 않습니다. 결과는 모델 아키텍처, 컨텍스트 길이, 캐시 재사용, 동시성, 도구 지연, 양자화 설정, 요구되는 응답 속도에 따라 달라질 수 있습니다. 컴파일러나 외부 API를 자주 기다리는 코딩 에이전트는 순수한 가속기 처리량보다 소프트웨어 및 오케스트레이션 오버헤드에 더 크게 제약받을 수 있습니다.

이 결과가 AI 개발자와 구매자에게 중요한 이유

AI 인프라 운영자에게 와트당 성능은 이제 단순한 환경 지표가 아니라 용량과 단위 경제성 지표가 되고 있습니다. 보고된 개선이 독립 테스트에서 유지된다면, 데이터센터 운영자는 고정된 전력 할당 내에서 더 많은 동시 에이전트 세션을 처리하거나, 더 적은 가속기와 더 낮은 운영비로 같은 용량을 제공할 수 있습니다.

이는 기업이 코딩 어시스턴트, 리서치 에이전트, 고객 서비스 시스템, 내부 자동화를 위한 AI 팩토리를 설계하는 방식에 영향을 줄 수 있습니다. 팀은 컨텍스트 캐싱, prefill과 decode 스케줄링, 모델 라우팅, 도구 호출 지연, 하위 에이전트 트래픽 처리까지 전체 워크플로를 최적화해야 할 수 있습니다. 이러한 주변 시스템을 바꾸지 않고 더 빠른 GPU만 선택하면 주장된 이점의 상당 부분이 실현되지 않을 수 있습니다.

이 결과는 인프라 벤더에 대한 경쟁 기준도 높입니다. 고정된 8K 입력·1K 출력 테스트는 통제된 비교에는 유용하지만, 상태를 가진 에이전트 트래픽에 대해서는 많은 것을 말해주지 못할 수 있습니다. AI 플랫폼을 평가하는 구매자는 해당 벤치마크가 컨텍스트 증가, 도구로 인한 중단, 캐시 재사용, 현실적인 사용자 경험 목표를 유지하는지 물어봐야 합니다.

모델 개발자에게는 장문맥 서빙과 mixture-of-experts 실행에 대한 강조가 인프라를 고려한 설계를 더 중요하게 만들 수 있습니다. 양자화와 캐싱은 비용을 낮출 수 있지만, 동시에 품질, 메모리 관리, 운영상의 트레이드오프를 가져오며, 이는 단일 처리량 수치가 아니라 실제 에이전트 워크플로에서 테스트해야 합니다.

앞으로 주목할 점

가장 즉각적인 신호는 SemiAnalysis의 Vera Rubin NVL72 AgentX 결과 검토입니다. 테스트 구성, 전력 산정, 모델 설정, 상호작용성 측정이 독립적으로 공개되면 30배 수치의 재현 가능성을 판단하는 데 도움이 될 것입니다.

추가 모델에 대한 벤치마크 결과도 중요합니다. NVIDIA는 DeepSeek V4 Pro와 Kimi K3를 특히 강조하지만, 에이전트 워크로드는 컨텍스트 증가, 전문가 라우팅, 도구 사용 측면에서 크게 다릅니다. 다른 코딩, 리서치, 엔터프라이즈 모델에서의 결과는 Rubin의 우위가 넓은지, 아니면 특정 서빙 패턴에 집중되는지 보여줄 수 있습니다.

배포 증거도 또 다른 시험대가 될 것입니다. NVIDIA의 주장은 공개된 고객 생산 결과가 아니라 사전 측정에 관한 것입니다. 구매자는 검증된 100만 토큰당 비용, 캐시 압력 하에서의 지속 성능, 도구 호출과 CPU 측 오케스트레이션을 포함한 완전한 엔드투엔드 지연 시간을 확인해야 합니다.

Creati.ai 관점

NVIDIA의 발표가 가장 중요한 이유는 인프라 경쟁의 기준을 전력 단위당 유용한 에이전트 작업으로 다시 설정하기 때문입니다. 헤드라인의 30배 주장은 아직 독립적 증거는 아니지만, AgentX 방법론은 오래된 추론 벤치마크의 실제 약점을 해결합니다. 기존 벤치마크는 AI 에이전트가 만들어내는 확장되고 중단되는 워크플로가 아니라 단일 요청을 모델링하는 경우가 많기 때문입니다.

개발자와 기업 구매자에게 실질적인 교훈은 가속기 사양만이 아니라 전체 서빙 시스템을 평가해야 한다는 것입니다. Rubin의 보고된 장점은 캐싱, 스케줄링, 모델 실행, 도구 오케스트레이션이 이를 실제 운영에서 더 낮은 지연 시간이나 더 낮은 토큰 비용으로 전환할 수 있을 때만 의미가 있습니다. 벤치마크 검토와 더 넓은 배포가 나오기 전까지는 NVIDIA의 수치를 중요한 공급업체 주장으로, 그리고 AI 인프라 경쟁이 향하는 방향의 신호로 봐야 합니다.

광고