NVIDIA는 Vera Rubin NVL72가 GB300보다 메가와트당 최대 30배 더 높은 에이전틱 추론 처리량을 제공할 수 있다고 밝히며, 이는 독립적인 벤치마크 검토를 기다리고 있다고 설명했습니다.

NVIDIA는 곧 출시될 Vera Rubin NVL72 플랫폼이 자사의 GB300 NVL72 시스템보다 메가와트당 최대 30배 더 높은 에이전틱 AI 처리량을 제공할 수 있다고 말합니다. 이 주장은 고정 길이의 챗봇 프롬프트가 아니라 실제 프로덕션 환경과 유사한 코딩 에이전트 세션을 재생하도록 설계된 벤치마크인 SemiAnalysis AgentX의 예비 결과에서 나온 것입니다.
이 결과가 중요한 이유는 AI 에이전트가 일반 채팅보다 훨씬 더 많은 추론 용량을 소비하기 때문입니다. NVIDIA의 출처는 OpenRouter 데이터를 인용하며, 단일 에이전틱 요청은 단순한 채팅 요청보다 약 15배 많은 토큰을 사용한다고 밝힙니다. 에이전트가 반복적으로 추론하고, 도구를 호출하고, 작업을 하위 에이전트에 위임하며, 작업 전체에 걸쳐 확장되는 컨텍스트를 유지하기 때문입니다.
Vera Rubin 비교는 아직 독립적으로 검증된 결과가 아닙니다. NVIDIA는 SemiAnalysis AgentX 워크로드를 사용해 수치를 측정했으며, 결과는 SemiAnalysis의 검토를 기다리고 있다고 말합니다. 따라서 이번 발표는 벤더가 보고한 초기 성능 신호일 뿐, 확정된 업계 벤치마크는 아닙니다.
AgentX는 SemiAnalysis의 InferenceX 벤치마크 제품군의 일부입니다. NVIDIA Developer Blog에 따르면, 이 벤치마크는 AIPerf 클라이언트를 통해 녹화된 Claude Code 세션을 다시 재생하며, 원래 경로에서 포착된 모델 호출 순서, 추론 간격, 도구 사용, 컨텍스트 증가, 도구 호출 지연을 그대로 보존합니다.
이러한 설계는 기존 추론 테스트의 약점을 보완하려는 시도입니다. 정적 테스트는 종종 8,000토큰 프롬프트 뒤에 1,000토큰 응답과 같이 미리 정해진 입력 및 출력 길이를 사용합니다. 실제 코딩 에이전트는 불규칙한 트래픽을 생성합니다. 작업은 모델 추론, 파일 작업, 검색, 컴파일러 출력, 추가 모델 호출 사이를 오가며, 누적된 컨텍스트는 시간이 지날수록 훨씬 커집니다.
AgentX는 첫 토큰까지의 시간, 엔드투엔드 지연, 상호작용성 같은 사용자 경험 지표와 함께 메가와트당 토큰 수를 측정합니다. NVIDIA의 주요 Vera Rubin 결과는 AgentX DeepSeek V4 Pro 워크로드에서 사용자당 초당 160토큰으로 측정되었습니다. 회사는 Vera Rubin NVL72가 해당 운영 지점에서 GB300 NVL72의 AI 팩토리 처리량 대비 메가와트당 최대 30배에 도달했다고 말합니다.
이 벤치마크는 현재 Blackwell 세대에 대해서도 상당한 향상을 보고합니다. NVIDIA는 GB300 NVL72가 DeepSeek V4 Pro 1.6T에서 H200 NVL8의 메가와트당 처리량보다 최대 15배 높은 성능을 제공하고, Kimi K3 2.8T에서는 최대 80배의 결과를 낸다고 말합니다. 이러한 수치 역시 NVIDIA의 AgentX 결과 보고를 통해 제시되며, 그에 맞게 해석해야 합니다.
NVIDIA는 예상되는 효율 향상이 Rubin GPU 단독이 아니라 하드웨어 규모와 소프트웨어 최적화의 조합에서 나온다고 설명합니다. NVL72 설계는 72개의 GPU를 scale-up 도메인으로 연결해, 고대역폭 상호연결을 통해 워크로드가 모델 전문가를 분산하고 시스템 전반에 걸쳐 컨텍스트를 유지할 수 있게 합니다.
이것은 장시간 실행되는 에이전트에 중요합니다. 이전에 처리한 컨텍스트는 종종 다시 계산하지 않고 재사용할 수 있기 때문입니다. NVIDIA는 시스템이 들어오는 컨텍스트를 처리하는 prefill과 출력을 생성하는 decode를 분리한 서빙 설계를 설명합니다. 이 단계들 사이의 처리 속도 균형은 한쪽이 유휴 상태가 되는 동안 다른 쪽이 병목이 되는 것을 막기 위한 것입니다.
회사는 또한 분산 키-값 캐싱, KV 인식 요청 라우팅, 그리고 호스트 메모리나 스토리지로의 캐시 오프로딩을 언급합니다. 이러한 기술은 커져 가는 에이전트 세션의 관련 부분을 여러 요청에 걸쳐 사용할 수 있도록 유지하기 위해 설계되었습니다. NVIDIA는 6세대 NVLink와 NVLink Switch 기술이 이 scale-up 통신에서 기존 Ethernet 대안보다 더 높은 패킷 처리율과 낮은 지연 시간을 제공한다고 말합니다.
소프트웨어 계층에는 NVIDIA TensorRT-LLM, NVIDIA Dynamo, 그리고 Mixture-of-Experts 모델에 최적화된 CUDA 커널이 포함됩니다. 개발자 중심 설명에는 더 넓은 최적화 스택에서 사용되는 서빙 런타임으로 SGLang과 vLLM도 언급되며, DeepGEMM 커널과 MXFP4, MXFP8 같은 저정밀 포맷도 포함됩니다. NVIDIA는 Rubin의 NVFP4 양자화가 메모리 사용량을 줄이고 처리량을 늘리면서 출력 품질을 유지하도록 설계되었다고 말하지만, 제공된 증거에는 독립적인 품질 평가는 없습니다.
NVIDIA는 또한 DSX MaxLPS 기술이 GPU, 랙, 워크로드 수준에서 전력을 관리해, 같은 메가와트 예산 내에서 최대 40% 더 많은 GPU를 수용할 수 있다고 밝힙니다. 이는 NVIDIA의 용량 계획 주장일 뿐, AgentX 수치만으로 입증된 결과는 아닙니다.
코딩 어시스턴트, 리서치 에이전트, 고객 서비스 자동화를 구축하는 팀에게 중요한 지표는 더 이상 하나의 프롬프트가 얼마나 빨리 답을 내놓는가만이 아닙니다. 프로덕션 에이전트는 여러 모델 호출을 동시에 유지하고, 큰 컨텍스트를 보존하며, 외부 도구가 데이터를 반환할 때까지 멈출 수 있습니다. 따라서 짧고 독립적인 요청에서는 잘 작동하는 인프라가 실제 워크플로에서는 전력을 낭비하거나 응답성을 잃을 수 있습니다.
Vera Rubin 발표는 전력 효율을 배포 제약이자 가격 문제로 제시합니다. NVIDIA는 Vera Rubin NVL72가 인용된 워크로드에서 GB300 NVL72 대비 백만 토큰당 비용을 최대 35배 줄일 수 있다고 말합니다. 별도로 개발자 블로그에서는 GB300이 H200 NVL8보다 최대 10배 낮은 토큰 비용을 제공할 수 있다고 보고합니다. 이러한 계산은 벤치마크 구성, 에너지 가정, 활용도에 따라 달라지므로, 기업 구매자는 자사 모델과 서빙 패턴으로 이를 검증해야 합니다.
이 결과는 특히 대형 Mixture-of-Experts 모델이나 매우 긴 세션의 에이전트를 서비스하는 운영자에게 중요할 수 있습니다. 이러한 환경에서는 메모리 이동, 캐시 재사용, 상호연결 동작이 단순한 가속기 연산만큼 중요할 수 있습니다. 그러나 작은 팀은 짧은 컨텍스트 모델, 낮은 동시성, 또는 기반 하드웨어를 숨기는 호스티드 API를 사용하는 경우 같은 경제성을 보지 못할 수도 있습니다.
신뢰성 문제도 있습니다. 더 공격적인 캐싱, 분리형 서빙, 도구 오케스트레이션은 활용도를 높일 수 있지만, 스케줄링과 상태 관리의 복잡성을 더합니다. 빌더는 최고 초당 토큰 수치에 의존하기보다 장애 복구, 캐시 무효화, 테일 지연, 워크로드 격리를 평가해야 합니다.
첫 번째 신호는 SemiAnalysis의 Vera Rubin AgentX 결과 검토가 될 것입니다. 테스트 구성, 전력 측정, 모델 설정, 상호작용성 목표를 독립적으로 공개하면 30x 주장이 시스템 간에 얼마나 비교 가능한지 결정될 것입니다.
구매자는 Vera CPU가 도구 호출에서 맡는 역할을 포함한 결과도 주목해야 합니다. NVIDIA는 초기 수치가 아직 워크플로의 해당 부분에 대한 Vera CPU 성능을 반영하지 않는다고 명시적으로 말합니다. 에이전트는 모델 생성 외부에서 시간을 보내므로, 엔드투엔드 측정은 가속기 전용 처리량과 다를 수 있습니다.
유용한 추가 확인 항목으로는 Vera Rubin NVL72의 출시 및 가격, DeepSeek V4 Pro를 넘어선 모델 성능, 그리고 녹화된 세션이 아니라 자체 트레이스를 실행하는 운영자들의 결과가 있습니다. NVIDIA의 소프트웨어 스택 변경도 비교에 영향을 줄 수 있는데, 회사는 Rubin과 GB300의 성능 모두 지속적인 최적화를 통해 향상될 것이라고 말합니다.
NVIDIA의 발표가 중요한 이유는 30x라는 최종 업계 표준을 확립해서가 아니라, 추론 성능의 정의가 바뀌고 있음을 보여주기 때문입니다. 에이전트 워크로드는 고정 프롬프트 테스트가 놓칠 수 있는 병목, 즉 컨텍스트 재사용, 도구 호출 간 공백, 캐시 용량, 동시성, 전력 공급 문제를 드러냅니다.
AI 빌더에게 주는 실질적 교훈은 인프라를 확정하기 전에 전체 에이전트 경로를 벤치마킹하라는 것입니다. NVIDIA의 초기 결과는 긴 세션의 에이전트 경제성이 긴밀하게 통합된 하드웨어와 서빙 소프트웨어로 크게 달라질 수 있음을 시사하지만, 그 이점의 규모는 기반 AgentX 측정이 독립적으로 검토되고 재현되기 전까지는 아직 확인되지 않았습니다.