NVIDIA, 에이전틱 추론 확장을 위해 Groq 3 LPX를 Vera Rubin에 투입

NVIDIA는 Groq 3 LPX를 Vera Rubin과 함께 본격 양산에 돌입시켰으며, 에이전트와 AI 클라우드 제공업체를 위한 더 빠른 장문맥 추론을 목표로 하고 있습니다.

AI News

NVIDIA는 자사의 추론 시스템 Groq 3 LPX가 본격 생산 단계에 들어갔으며, 랙 스케일 플랫폼인 Vera Rubin NVL72와 통합되고 있다고 밝혔다. 이 조합은 모델이 반복적으로 추론하고, 도구를 호출하고, 점점 더 길어지는 대화 또는 작업 이력을 처리하는 에이전틱 애플리케이션에서 토큰 생성을 가속하도록 설계됐다.

이번 발표는 NVIDIA의 Vera Rubin 전략을 범용 가속 컴퓨팅을 넘어 확장한다. 회사는 Rubin GPU를 대규모 컨텍스트 처리에 배치하고, Groq 3 LPX는 지연 시간에 민감한 디코딩, 즉 모델이 한 번에 하나의 토큰씩 출력을 생성하는 단계를 담당하도록 포지셔닝하고 있다. 이러한 분업은 대규모 배포에서 처리량을 포기하지 않으면서 더 반응성 높은 에이전트를 원하는 AI 클라우드 제공업체와 기업을 겨냥한다.

NVIDIA, Vera Rubin에 저지연 계층 추가

NVIDIA에 따르면 Groq 3 LPX는 Vera Rubin NVL72를 대체하는 것이 아니라 함께 작동하도록 설계된 대화형 AI 추론 가속기다. 회사는 이 플랫폼을 GPU와 LPU(local processing units)의 조합으로 설명하며, 각 구성 요소는 가장 효과적인 워크로드에 할당된다.

이러한 분리가 필요한 이유는 에이전틱 워크로드의 동작 방식 때문이다. 에이전트는 답변을 생성하고, 외부 도구를 사용하고, 새로운 정보를 받은 뒤 또 다른 추론 턴을 시작할 수 있다. 각 턴은 세션의 컨텍스트를 늘려 결국 시스템이 수만 또는 수십만 개의 토큰을 처리하면서도 빠르게 응답을 생성해야 하게 만든다.

NVIDIA는 Rubin GPU가 대규모 컨텍스트 처리 워크로드를 관리할 수 있는 반면, Groq 3 LPX는 디코드 성능에 최적화돼 있다고 말한다. 또한 이 시스템은 prefill-decode disaggregation, attention-FFN disaggregation, external-drafter speculative decoding으로도 구성할 수 있다. 이는 모델 서빙 작업을 분리하거나 예측된 토큰을 사용해 응답 속도를 높이는 인프라 기술이다.

NVIDIA에 따르면 랙 스케일 배포에는 직접 칩 간 링크로 연결된 256개의 LP30 가속기가 포함될 수 있다. 회사의 개발자 문서는 이 칩들 전체에 걸쳐 128GB의 결합 SRAM과, 실행 전에 계산과 통신을 계획하는 컴파일러를 설명한다. 이러한 결정론적 접근은 모델을 작은 배치 크기로 제공할 때 특히 커질 수 있는 조정 오버헤드를 줄이기 위한 것이다.

벤치마크가 보여주는 것과 보여주지 않는 것

NVIDIA의 가장 강한 성능 주장은 Artificial Analysis 벤치마크에서 나온다. 이는 벤더가 인용한 제3자 측정치이며, 광범위한 실제 생산 성능을 보여주는 독립 증거는 아니다. NVIDIA 개발자 블로그에 따르면, Gemma 4 31B 모델과 100,000 토큰 컨텍스트에서 Artificial Analysis는 Groq 3 LPX의 중앙값 출력 속도를 초당 3,431 토큰으로 측정했다.

NVIDIA의 기업 발표는 이 수치를 초당 3,400 출력 토큰으로 반올림하며, 가장 가까운 대안 플랫폼보다 4배 빠른 결과였다고 말한다. 원자료는 발표에서 그 경쟁 플랫폼을 특정하지 않기 때문에, उपलब्ध한 증거만으로는 이 비교를 독립적으로 평가할 수 없다.

두 번째 결과는 Gemma 4를 사용하는 코딩 벤치마크 SPEED-Bench에서 나왔다. NVIDIA는 중앙값 초당 4,767 출력 토큰과 80퍼센타일 결과 5,520 토큰을 보고한다. 이 수치들은 특정 모델, 컨텍스트, 테스트 방법론을 설명할 뿐이며, 모델, 배치 크기, 컨텍스트 길이, 실제 트래픽 패턴 전반에 대한 보편적 성능 지표로 간주해서는 안 된다.

NVIDIA가 제시한 기술적 설명은 Groq 3 LPX가 컴파일러가 스케줄링한 칩 간 통신을 사용하고 데이터 이동과 계산을 겹친다는 것이다. 기존의 병렬 추론에서는 작업을 프로세서에 분산하면 동기화와 집단 통신 비용이 생길 수 있다. NVIDIA는 전송을 사전에 계획하면 특히 높은 상호작용성을 가진 서비스에서 쓰이는 작은 배치 크기에서 일부 실시간 조정이 필요 없어질 수 있다고 주장한다.

어느 자료도 고객 배포 규모, 가격, 전력 소비, 일반 개발자용 제공 일정, 독립 검증된 생산 활용률을 제공하지 않는다. 증거는 NVIDIA의 제품 및 아키텍처 주장을 뒷받침하지만, 다양한 상업적 워크로드 전반에서 시스템이 경제적으로 어떻게 작동하는지는 아직 보여주지 않는다.

초기 클라우드 및 인프라 도입 기업

NVIDIA는 Vera Rubin 확장과 관련된 세 파트너를 언급한다. Nebius는 Groq 3 LPX를 채택한 최초의 AI 클라우드로 소개된다. NVIDIA는 해당 하드웨어가 회사의 Token Factory에 추가되어 개발자들이 대화형 에이전트, 코딩 시스템, 기타 실시간 애플리케이션을 대규모로 구축할 수 있게 된다고 말한다.

한편 CoreWeave는 NVIDIA에 따르면 Spectrum-X Multiplane을 생산 환경에 배포했다. 이 네트워킹 시스템은 여러 병렬 스위치를 통해 Vera Rubin 랙을 연결하며, AI 클라우드 인프라 전반에 걸쳐 높은 대역폭과 무손실 통신을 제공하는 것을 목표로 한다.

NVIDIA는 또한 SpaceXAI가 차세대 에이전틱 AI 아키텍처에서 Vera CPU를 사용할 계획이라고 말한다. 회사는 이 CPU를 오케스트레이션, 도구 사용, 코드 실행, 데이터 처리, 시뮬레이션과 연결하며, 여기에는 지상 데이터센터와 궤도 위성을 아우르는 인프라도 포함된다. 이는 발표된 계획일 뿐, 그런 배포가 이미 대규모로 운영되고 있다는 증거는 아니다.

이러한 파트너 언급은 NVIDIA가 Vera Rubin을 완전한 AI 팩토리 스택으로 판매하고 있음을 보여준다. 즉, 오케스트레이션과 범용 작업용 CPU, 컨텍스트와 모델 연산용 GPU, 빠른 디코딩용 Groq 가속기, 그리고 구성 요소를 연결하는 네트워킹이다. 상업적 의미는 고객이 서로 다른 서빙 단계에 최적화된 별도의 가속기 풀보다 이 스택을 더 효율적으로 배포할 수 있는지에 달려 있다.

이 설계가 AI 빌더와 기업에 중요한 이유

코딩 어시스턴트, 리서치 에이전트, 고객 서비스 시스템을 만드는 사람들에게 디코드 지연은 사용자가 직접 체감한다. 첫 응답이 더 빠르거나 중간 출력이 더 빨라지면, 특히 에이전트가 많은 순차적 호출을 수행해야 할 때 다단계 워크플로가 더 상호작용적으로 느껴질 수 있다.

장문맥도 인프라 방정식을 바꾼다. 세션이 자신의 이력을 반복적으로 다시 처리하면, 모델 자체가 아주 크지 않더라도 상당한 메모리와 연산을 소모할 수 있다. NVIDIA의 설계는 대형 key-value 캐시, 소배치 추론, 프로세서 간 빈번한 통신의 조합을 목표로 한다.

기업이 실제로 따져야 할 것은 초당 최대 토큰 수보다 실제 트래픽에서의 서비스 수준 성능이다. 구매자는 동시성 수준, 컨텍스트 크기, 모델 아키텍처에 따른 지연 시간은 물론, 특화된 추론 용량을 계속 활용하는 비용도 평가해야 한다. 벤치마크 작업에서는 매우 빠른 시스템이라도 수요가 변동하거나 애플리케이션이 아직 플랫폼에 최적화되지 않은 모델과 소프트웨어를 필요로 하면 매력도가 떨어질 수 있다.

이번 발표는 추론 특화 경쟁도 심화시킨다. NVIDIA는 더 넓은 플랫폼 영향력을 활용해 전용 저지연 가속기를 향후 GPU, CPU, 네트워킹 제품과 결합하고 있다. 이는 차별화된 추론 서비스를 구축하는 클라우드 제공업체에 매력적일 수 있지만, 단일 가속기 아키텍처보다 소프트웨어와 운영 복잡성도 높인다.

다음에 주목할 점

가장 분명한 후속 신호는 Nebius가 Groq 3 LPX 기반 서비스를 개발자에게 공개하고, 생산 성능, 가격, 용량 정보를 발표하는지 여부다. 그런 세부 사항은 하드웨어 발표와 일반적으로 접근 가능한 서빙 옵션을 구분하는 데 도움이 될 것이다.

고객은 Gemma 4 31B와 보고된 코딩 벤치마크를 넘어서는 독립 결과도 주시해야 한다. 더 크거나 작은 모델, 다양한 컨텍스트 길이, 동시 사용자, 완전한 에이전틱 워크플로 전반의 결과는 플랫폼 평가를 위한 더 강한 근거를 제공할 것이다.

CoreWeave와 SpaceXAI의 배포 증거도 또 다른 중요한 지표다. NVIDIA는 CoreWeave의 생산 네트워킹 배포를 확인했고 SpaceXAI의 Vera CPU 계획을 설명했지만, 출처에는 규모, 워크로드, 활용도 데이터가 없다. 전력 효율, 소프트웨어 지원, 인기 있는 추론 프레임워크와의 호환성 역시 이 아키텍처가 NVIDIA가 지목한 파트너를 넘어 채택될지를 좌우할 것이다.

Creati.ai 시각

NVIDIA의 이번 소식은 단순히 또 다른 추론 칩의 출시가 아니라, 생산 및 시스템 통합의 이정표로 이해하는 것이 가장 적절하다. 회사는 특정 서빙 문제에 대응하고 있다. 에이전트는 큰 컨텍스트를 유지한 채 긴 토큰 체인을 생성하므로, 디코드 지연과 인터커넥트 오버헤드가 모두 상업적으로 중요하다.

보고된 결과는 유망하지만, 벤더가 선택한 벤치마크와 제한된 공개 배포 증거에 의해 여전히 제약된다. AI 팀에게 중요한 시험은 Groq 3 LPX와 Vera Rubin이 자사 에이전트 워크로드에서 예측 가능한 지연 시간과 수용 가능한 경제성을 제공하는지 여부다. 그렇게 된다면 NVIDIA의 통합된 “토큰 팩토리” 접근 방식은 높은 상호작용성이 필요한 서비스에 진지한 옵션이 될 수 있다. 그렇지 않다면, 강력한 최고 성능에도 불구하고 특화 구성 요소는 여전히 정당화하기 어려울 수 있다.

광고