NVIDIA는 Vera Rubin NVL72가 GB300보다 메가와트당 최대 30배 더 높은 에이전틱 AI 처리량을 제공해 장문맥 추론 비용을 겨냥한다고 말한다.

NVIDIA는 곧 출시될 Vera Rubin NVL72 플랫폼이 자사의 GB300 NVL72 시스템보다 메가와트당 최대 30배 더 많은 에이전틱 AI 처리량을 제공할 수 있다고 밝혔으며, 점점 더 길고 도구를 사용하는 AI 워크플로를 실행하는 데이터센터에 잠재적인 효율 향상을 제시하고 있다.
이 주장은 기록된 코딩 세션, 확장된 컨텍스트, 도구 호출, 서브에이전트 활동을 보존하는 SemiAnalysis AgentX 워크로드를 사용한 NVIDIA의 초기 측정에서 나온 것이다. NVIDIA는 AI 에이전트가 단일 턴 채팅을 넘어 다단계 연구, 코딩, 고객 서비스, 의사결정 지원 작업을 수행하기 시작하면서 이 결과가 특히 중요하다고 말한다.
수치는 벤더 보고치이며 아직 독립적으로 검증되지 않았다. NVIDIA는 Vera Rubin 결과가 현재 SemiAnalysis의 검토를 기다리고 있으며, 테스트에 도구 호출을 위한 Vera CPU 성능은 포함되지 않았다고 밝혔다.
NVIDIA의 비교는 고립된 추론 요청에서의 초당 최대 토큰 수가 아니라 메가와트당 처리량에 초점을 맞춘다. 이 구분은 모델이 누적된 컨텍스트를 반복적으로 읽고, 외부 도구를 호출하고, 하위 작업을 위임하고, 결과를 종합할 수 있는 에이전틱 시스템에서 중요하다.
NVIDIA에 따르면 AgentX는 실제 에이전틱 코딩 경로를 통해 이러한 행동을 나타낸다. 회사는 이 벤치마크에 Kimi K3, MiniMax M3, GLM5.3, Qwen3.5, DeepSeek V4 Pro 같은 모델이 포함되어 있어 다양한 모델 아키텍처와 워크로드에서 성능을 평가할 수 있다고 말한다.
DeepSeek V4 Pro에서 NVIDIA는 GB300 NVL72가 Hopper 아키텍처 대비 메가와트당 최대 15배의 처리량을 제공한다고 보고한다. 이어 Vera Rubin은 GB300 NVL72 대비 이 수치를 추가로 최대 30배까지 끌어올린다고 주장된다. 이는 언급된 워크로드와 모델에서의 최대 결과일 뿐, 모든 배포가 같은 향상을 보장한다는 뜻은 아니다.
NVIDIA는 또한 GB300 NVL72 대비 백만 토큰당 비용이 최대 35배 낮다고 보고한다. 회사는 이 지표를 AI 팩토리의 경제성과 연결하며, 전력 용량이 가동 가능한 GPU 수를 제한하고 토큰 비용이 추론 서비스의 마진에 영향을 준다고 설명한다.
전통적인 채팅 요청은 비교적 짧은 입력과 출력을 포함할 수 있다. NVIDIA는 채팅이나 문서 요약의 일반적인 시퀀스를 대략 1,000~8,000 토큰으로 설명한다. 에이전트 세션은 이전 단계, 도구 결과, 서브에이전트 출력이 후속 단계에서 계속 사용 가능하기 때문에 수십만 개의 입력 토큰을 누적할 수 있다.
이는 다른 시스템 문제를 만든다. 인프라는 많은 불규칙한 요청에 대해 응답 속도를 유지하면서 방대한 컨텍스트를 처리해야 한다. 워크로드는 컨텍스트 처리, 즉 프리필(prefill)과 응답 생성, 즉 디코드(decode) 사이를 오갈 수도 있다. 두 단계를 동일하게 다루면 일부 GPU는 유휴 상태가 되고 다른 GPU는 병목이 될 수 있다.
NVIDIA의 해법은 하드웨어와 소프트웨어 기술을 결합하는 것이다. 분리형 서빙(disaggregated serving)은 프리필과 디코드 자원을 별도로 확장할 수 있게 하고, 레이트 매칭은 두 단계를 동기화하려고 한다. 분산 KV 캐시 시스템은 이전에 처리한 컨텍스트를 GPU 도메인 전반에서 사용할 수 있게 유지하며, KV 인식 라우팅은 관련 캐시 데이터를 이미 보유한 하드웨어로 요청을 보낼 수 있다.
이 플랫폼은 또한 Mixture-of-Experts 모델을 위한 대규모 전문가 병렬화, 계산과 통신을 결합하도록 설계된 CUDA 커널, 모델 가중치에 필요한 메모리를 줄이기 위한 NVFP4 양자화에 의존한다. NVIDIA는 5세대 Tensor Core와 Transformer Engine이 추론의 두 주요 단계를 모두 지원한다고 말한다.
이 기사에서 가장 강한 성능 주장은 독립적인 벤치마크 보고서가 아니라 NVIDIA 자체의 인프라 및 개발자 블로그에서 나온 것이다. 회사는 워크로드 설계를 SemiAnalysis AgentX에 귀속시키지만, Vera Rubin 결과는 아직 SemiAnalysis 검토를 기다리고 있다고 말한다. 따라서 이 수치는 확정된 업계 비교가 아니라 NVIDIA의 목표 성능에 대한 초기 संकेत이다.
비교에는 여러 제한도 있다. NVIDIA는 최대 향상을 보고하므로 결과는 모델 선택, 컨텍스트 길이, 요청 혼합, 배치, 소프트웨어 버전, 전력 관리 설정에 따라 달라질 수 있다. 인용된 Vera Rubin 측정에는 생산 에이전트의 중요한 부분인 도구 호출용 CPU 작업이 제외되어 있다. 실제 애플리케이션은 토큰을 생성하기보다 데이터베이스, API, 엔터프라이즈 시스템을 기다리는 데 상당한 시간을 보낼 수도 있다.
NVIDIA는 자사의 DSX MaxLPS 기술이 GPU, 랙, 워크로드 수준에서 전력을 관리하고 같은 메가와트 예산 내에서 최대 40% 더 많은 GPU를 배치할 수 있다고 말한다. 이것 역시 회사의 주장으로, 실제 가치는 냉각, 랙 설계, 활용도, 배포된 워크로드의 동작에 달려 있다.
이 아키텍처의 경제성은 TensorRT LLM과 NVIDIA Dynamo를 포함한 NVIDIA의 더 넓은 소프트웨어 스택과 연결되어 있다. 회사는 NVL72 스케일업 도메인과 6세대 NVLink 기술이 분산 캐싱과 전문가 병렬화에 필요한 통신 대역폭을 제공한다고 주장한다. 이러한 설계 선택은 성능을 개선할 수 있지만, NVIDIA의 하드웨어, 네트워킹, 소프트웨어 생태계에 대한 의존도도 강화한다.
AI 애플리케이션 팀에게 이번 발표는 에이전트 비용을 단일 모델 응답의 가격만으로 평가할 수 없다는 점을 강조한다. 성장하는 컨텍스트를 반복해서 재사용하는 리서치 에이전트는 사용자가 최종 답변 하나만 보더라도 채팅 어시스턴트보다 훨씬 더 많은 추론 작업을 생성할 수 있다.
따라서 인프라 팀은 완료 작업당 비용, 워크플로당 에너지, 현실적인 컨텍스트 성장 하에서의 처리량 같은 지표를 추적해야 한다. 짧은 프롬프트에서는 잘 작동하는 플랫폼도 에이전트가 도구를 호출하고, 서브에이전트를 만들고, 긴 기록을 다시 살펴볼 때는 효율적이지 않을 수 있다.
기업 구매자에게 당장의 질문은 단순히 Vera Rubin이 GB300보다 빠른가가 아니다. 조직에 새 플랫폼을 정당화할 만큼 지속적인 에이전트 트래픽이 있는지, 그리고 애플리케이션이 캐싱, 프리필-디코드 분리, 모델 양자화 같은 기능을 활용할 수 있는지가 중요하다. 중간 규모이거나 예측하기 어려운 워크로드를 가진 팀은 여전히 공유 클라우드 추론을 선호할 수 있고, 대형 AI 서비스 제공업체와 전력 제약이 있는 데이터센터는 메가와트당 작업을 최적화해야 할 더 강한 이유가 있다.
이 발표는 또한 소프트웨어 이식성 문제를 제기한다. NVIDIA가 보고한 성과는 GPU, NVLink, CUDA, TensorRT LLM, NVIDIA Dynamo 간 공동 설계에 의존한다. 이 스택을 사용하는 빌더는 더 많은 최적화를 얻을 수 있지만, 나중에 모델이나 서빙 워크로드를 다른 가속기 플랫폼으로 옮길 경우 추가 마이그레이션 작업이 필요할 수 있다.
첫 번째 신호는 SemiAnalysis AgentX 결과에 대한 독립 리뷰가 될 것이다. 이는 테스트가 어떻게 구성되었는지, 어떤 측정이 가장 큰 향상을 냈는지, 다양한 모델과 컨텍스트 길이에서 Vera Rubin이 GB300과 어떻게 비교되는지 명확히 해줄 것이다.
구매자는 또한 실제 배포 가능 시점, 시스템 수준 전력 측정, CPU 기반 도구 오케스트레이션을 포함한 결과를 주시해야 한다. 이러한 세부사항은 토큰 생성 효율과 엔드투엔드 에이전트 효율을 구분하는 데 도움이 된다.
마지막으로 시장은 배포 증거를 필요로 한다. 가장 의미 있는 비교는 헤드라인 처리량만이 아니라 실제 워크로드에서 완료된 에이전트 작업, 지연시간, 신뢰성, 활용도, 총 운영 비용을 측정해야 한다.
NVIDIA의 발표는 에이전트 배포의 실제 병목을 지적한다. 장문맥, 다단계 추론은 사용자에게 보이는 요청 수가 시사하는 것보다 더 빠르게 연산 수요를 증폭시킬 수 있다. 따라서 메가와트당 작업을 측정하는 것은 전통적인 채팅 벤치마크에 의존하는 것보다 대규모 에이전트에 더 중요하다.
하지만 30배 수치는 공급업체가 통제한 초기 성능 주장으로 봐야 한다. 그 의미는 독립적인 재현 가능성과, 개선이 생산 에이전트의 거친 부분인 도구 지연, 오케스트레이션, 실패한 호출, 고르지 않은 트래픽, 엔드투엔드 비용을 견딜 수 있는지에 달려 있다. 빌더에게 주는 실질적 교훈은 짧은 컨텍스트 토큰 비율만 보고 인프라를 선택하기 전에 지금 완전한 워크플로를 벤치마크하라는 것이다.