AI News

NVIDIA says its Groq 3 LPX inference accelerator has entered full production as part of the Vera Rubin platform, giving cloud providers and enterprise infrastructure teams a specialized option for generating tokens quickly in long-context, agent-driven workloads.

The announcement positions Groq 3 LPX as a companion to NVIDIA’s Vera Rubin NVL72 rather than a replacement for its general-purpose GPUs. Rubin GPUs are intended to handle context processing, while the LPX system focuses on the latency-sensitive decode phase in which models produce responses one token at a time. That distinction matters as AI applications move from single-turn answers toward agents that repeatedly reason, call tools, exchange information with other systems and maintain large working contexts.

디코드 지연 시간에 초점을 맞춘 생산 시스템

NVIDIA는 Groq 3 LPX를 Vera Rubin 아키텍처에서 가장 높은 응답성을 요구하는 서비스 계층을 위해 설계된 대화형 추론 가속기로 설명한다. NVIDIA의 개발자 문서에 따르면 랙 규모 배포에는 칩 간 직접 링크로 연결된 256개의 LP30 가속기와 128GB의 SRAM 기반 통합 메모리가 포함될 수 있다.

이 시스템은 결정론적이고 컴파일러가 스케줄링하는 실행 모델을 사용한다. 데이터가 프로세서 사이에서 언제 이동할지 실시간 중재에 크게 의존하는 대신, 컴파일러가 작업이 시작되기 전에 계산과 통신을 계획할 수 있다. NVIDIA는 이를 통해 매우 작은 배치 크기에서 텐서 병렬 처리의 효용을 떨어뜨릴 수 있는 조정 오버헤드를 줄일 수 있다고 말한다.

이 설계는 에이전틱 AI 서비스의 특정 약점을 겨냥한다. 에이전트는 하나의 작업 중에 많은 짧은 출력을 생성해야 할 수 있으며, 각 응답은 또 다른 도구 호출, 모델 턴 또는 데이터베이스 작업을 유발한다. 토큰 생성의 작은 지연도 이러한 단계 전반에 걸쳐 누적될 수 있다. 긴 세션은 또한 확장되는 컨텍스트를 반복적으로 모델에 다시 입력하게 만들어, 기반 모델이 충분히 강력하더라도 응답성을 유지하기 어렵게 만든다.

NVIDIA의 아키텍처는 작업을 플랫폼 전반에 걸쳐 분산한다. Vera Rubin NVL72는 대규모 컨텍스트 처리를 담당하고, Groq 3 LPX는 토큰 생성을 가속한다. 회사는 또한 두 시스템이 prefill-decode 분리, attention-FFN 분리, 외부 drafter를 사용한 speculative decoding 같은 구성도 지원할 수 있다고 말한다.

벤치마크 증거가 보여주는 것

NVIDIA는 Groq 3 LPX와 Vera Rubin NVL72를 결합한 시스템이 Gemma 4 31B를 사용한 Artificial Analysis의 100K-context 벤치마크에서 초당 3,431개의 출력 토큰을 기록했다고 밝힌다. 별도의 NVIDIA 발표에서는 이 결과를 초당 3,400 토큰으로 반올림하고, 가장 근접한 대안 플랫폼보다 4배 빠르다고 말했다.

이는 उपलब्ध 증거 중 가장 강한 성능 주장들이지만, 해석이 필요하다. 벤치마크 결과는 NVIDIA가 Artificial Analysis를 인용해 보고한 것이며, 비교의 “4배 빠르다”는 주장도 NVIDIA에서 나온 것이다. 개발자 게시물은 이를 Groq 3 LPX 시스템의 첫 번째 제3자 벤치마크라고 부르지만, 제공된 자료에는 전체 테스트 구성, 경쟁 플랫폼, 독립적으로 재현된 결과가 없다.

NVIDIA는 또한 일반적인 에이전틱 및 코딩 워크로드에서 SPEED-Bench의 중앙값 결과로 초당 4,767 출력 토큰을 제시한다. 이 수치 역시 NVIDIA의 개발자 자료에 제시되어 있다. 이를 보편적인 서비스 처리 속도로 받아들여서는 안 된다. 실제 성능은 모델 아키텍처, 컨텍스트 길이, 동시성, 스케줄링, 정밀도, 네트워킹, 주변 소프트웨어 스택에 따라 달라진다.

그럼에도 벤치마크의 초점은 중요하다. 기존의 가속기 비교는 보통 총 처리량이나 학습 속도를 강조한다. NVIDIA는 대신 100,000토큰 컨텍스트와 낮은 배치 크기에서의 출력 속도를 강조하는데, 이는 대량 오프라인 추론보다 대화형 에이전트에 더 가까운 조건이다. 제품팀 입장에서는 사용자가 에이전트가 일련의 작업을 완료하기를 기다리는 상황에서 더 관련성 높은 지표가 될 수 있다.

초기 도입 신호는 여전히 벤더 보고에 기반한다

NVIDIA는 Nebius를 Groq 3 LPX를 도입한 최초의 AI 클라우드 제공업체로 지목한다. 회사는 Nebius가 이 가속기를 Token Factory 서비스에 추가해 개발자들이 대화형 에이전트, 코딩 시스템, 기타 실시간 애플리케이션을 대규모로 구축할 수 있게 할 것이라고 말한다. 그러나 증거에는 Nebius의 배포 규모, 상용 제공 시점, 고객 약정은 명시되어 있지 않다.

NVIDIA는 또한 CoreWeave가 여러 병렬 스위치를 통해 Vera Rubin 랙을 연결하기 위해 Spectrum-X Multiplane을 프로덕션에 배포했다고 말한다. 이 발표는 플랫폼 주변의 네트워크 계층에 관한 것이며, CoreWeave가 Groq 3 LPX 자체를 배포했다는 증거는 아니다.

세 번째 채택 신호는 SpaceXAI에서 나온다. NVIDIA에 따르면 이 회사는 차세대 에이전틱 AI 아키텍처에서 Vera CPU를 사용할 계획이다. 언급된 사용 사례에는 오케스트레이션, 도구 사용, 코드 실행, 데이터 처리, 시뮬레이션이 포함되며, 데이터센터와 궤도 위성 전반에 배포가 이루어진다. 이는 NVIDIA가 보고한 회사 계획이지, 완료된 프로덕션 롤아웃의 증거는 아니다.

현재 이용 가능한 보도는 NVIDIA 자체 블로그와 개발자 자료에 크게 의존하고 있으므로, 채택은 독립적으로 검증된 시장 견인력이라기보다 발표된 생태계 활동으로 보는 것이 타당하다. SiliconANGLE의 소스 항목은 뉴스의 방향은 확인하지만, 제공된 증거에는 추가 기사 본문이나 보도 세부 사항이 없다.

이 하드웨어가 AI 개발자에게 중요한 이유

AI 애플리케이션 개발자에게 가장 즉각적인 질문은 Groq 3 LPX가 높은 최대 토큰 처리 속도를 갖고 있느냐가 아니다. 에이전트가 여러 턴과 큰 컨텍스트 윈도우를 오갈 때 예측 가능한 지연 시간을 제공할 수 있느냐가 핵심이다.

그럴 경우 이 시스템은 코딩 보조 도구, 리서치 에이전트, 고객 서비스 워크플로우, 그리고 사용자가 각 중간 모델 응답의 지연을 체감하는 오케스트레이션 시스템에 의미가 있을 수 있다. 더 빠른 디코드는 체감 반응성을 개선할 수 있고, 결정론적 스케줄링은 성능이 경합과 소규모 배치 조정 비용에 덜 민감하다면 용량 계획을 더 쉽게 만들 수 있다.

대신 구조적 복잡성이 따른다. Groq 3 LPX는 Vera Rubin NVL72의 확장으로 제시되며, 호스트 플랫폼, 인터커넥트, 컴파일러, 모델 서빙 소프트웨어와 분리해 평가할 수 있는 플러그인형 가속기가 아니다. 구매자는 장문 컨텍스트용 메모리 용량, 네트워크 토폴로지, 모델 호환성, 예상 트래픽에서의 활용률, prefill과 decode 자원 사이로 워크로드를 옮기는 비용을 포함한 전체 시스템을 평가해야 한다.

NVIDIA의 메시지는 인프라 경제의 더 큰 변화를 반영하기도 한다. 에이전트가 더 많은 토큰을 생성하고 더 많은 추론 턴을 수행할수록, 서비스 비용과 지연은 초기 모델 학습 비용보다 더 큰 제약이 될 수 있다. 특화된 디코드 엔진은 대화형 워크로드의 활용률을 높일 수 있지만, 총비용을 낮출 수 있는지는 제공업체가 Rubin GPU와 LPX 가속기를 얼마나 일관되게 가동할 수 있는지에 달려 있다.

다음에 주목할 점

다음으로 유용한 신호는 전체 구성, 경쟁 시스템, 모델 버전, 정밀도 설정, 컨텍스트 길이, 동시성 수준을 공개하는 독립 테스트에서 나올 것이다. 여러 배치 크기에서의 결과는 Groq 3 LPX의 우위가 고도로 대화형인 소규모 배치 서비스 이상으로 확장되는지 판단하는 데 도움이 된다.

개발자들은 Nebius Token Factory를 통한 프로덕션 가용성 증거, 지원 모델, 가격, 서비스 수준 보장, 그리고 더 넓은 Vera Rubin 스택을 도입하지 않고도 시스템에 접근할 수 있는지 여부도 살펴봐야 한다. CoreWeave나 다른 클라우드 제공업체의 확인된 배포는 상업적 견인력을 더 분명하게 보여줄 것이다.

마지막으로 시장은 NVIDIA가 컴파일러, 네트워킹, 서빙 소프트웨어를 일반적인 에이전트 프레임워크와 어떻게 통합하는지 확인해야 한다. 기술적 약속은 개별 디코드 단계의 가속뿐 아니라 모델 실행, KV 캐시 관리, 도구 호출, 멀티에이전트 트래픽의 조정에 달려 있다.

Creati.ai 관점

Groq 3 LPX가 주목할 만한 이유는 NVIDIA가 모델이 장기 에이전트 루프 안에 들어간 뒤에야 드러나는 병목, 즉 큰 컨텍스트를 유지하면서 많은 순차 토큰을 생성할 때 누적되는 지연을 겨냥하고 있기 때문이다. 이번 발표는 단순한 독립형 칩 출시라기보다, 랙 규모 시스템 전반에 걸쳐 추론을 특화된 단계로 분할하는 것에 가깝다.

대화형 에이전트를 제공하는 사업자에게 기회는 크지만, 증거는 여전히 주로 벤더가 통제한다. 독립 벤치마크와 고객 배포가 총비용, 소프트웨어 요구사항, 실제 워크로드에서의 지속 성능을 명확히 하기 전까지, Groq 3 LPX는 기술적으로 초점을 맞춘 프로덕션 제공 제품으로 보되, 시장 영향은 유망하지만 아직 완전히 검증되지는 않은 것으로 보는 것이 적절하다.

추천

NVIDIA, 장문 컨텍스트 AI 추론을 위해 Groq 3 LPX를 본격 생산 체제로 전환

NVIDIA는 Groq 3 LPX가 Vera Rubin과 함께 본격 생산에 들어갔으며, AI 에이전트와 멀티턴 워크로드를 위한 더 빠른 장문 컨텍스트 추론을 목표로 한다고 밝혔다.