AWS는 SageMaker AI에서 G5, G6, G6e, G7 전반에 걸쳐 30B MoE 모델을 벤치마킹하며, Blackwell이 추론 비용과 지연을 어떻게 개선할 수 있는지 보여준다.

Amazon Web Services는 Amazon SageMaker AI의 프로덕션 추론용 GPU 세대를 비교하기 위해 두 개의 300억 파라미터 Mixture-of-Experts 모델을 사용하고 있다. 이 회사의 벤치마크는 G5, G6, G6e, 그리고 새로운 G7 구성을 처리량, 지연 시간, 토큰당 비용 측면에서 검토하며, AWS는 NVIDIA Blackwell 기반 G7 인스턴스가 특정 워크로드에서 더 나은 가격 대비 성능을 제공할 수 있다고 보고한다.
이 벤치마크가 중요한 이유는 모델 크기만으로 서비스 경제성이 결정되지 않기 때문이다. 양자화, 메모리 대역폭, 전문가 라우팅, 그리고 서빙 소프트웨어 스택은 모두 어떤 인스턴스가 가장 실용적인 선택인지 바꿀 수 있다. 따라서 AWS의 Machine Learning Blog에 게시된 결과는 GPU 제품군의 보편적 순위라기보다 배포 연구로 읽는 것이 가장 적절하다.
AWS는 코드 생성, 디버깅, 리팩터링, 개발자 코파일럿을 포함한 코딩 사용 사례를 위해 Qwen3-Coder-30B-A3B-Instruct-FP8를 테스트했다. 이 실험은 NVIDIA A10G GPU를 사용하는 ml.g5.12xlarge 인스턴스, NVIDIA L4 GPU를 사용하는 ml.g6.12xlarge 인스턴스, RTX PRO 4500 Blackwell GPU를 사용하는 ml.g7.12xlarge 인스턴스를 비교한다. 이 테스트는 SageMaker AI DJL Large Model Inference 컨테이너를 사용한다.
회사의 두 번째 시나리오는 추론, 질의응답, 요약, 에이전트형 워크로드를 위해 NVIDIA Nemotron-3-Nano-30B-A3B-NVFP4를 사용한다. 고정 엔드포인트만 배포하는 대신, AWS는 vLLM과 함께 SageMaker AI Generative AI Inference Recommendations를 사용하여 G6, G6e, G7 옵션을 평가하고 선택한 최적화 목표를 기반으로 구성을 식별한다.
이 구분은 중요하다. Qwen3-Coder-30B 테스트는 예상되는 코딩 워크로드 아래에서 배포된 엔드포인트를 직접 비교한 것이다. Nemotron-3-Nano-30B 작업은 SageMaker AI가 후보 구성을 평가하고 비용, 지연 시간, 처리량 같은 지표에 따라 순위를 매기는 자동 추천 프로세스를 나타낸다.
구성들은 동일한 양의 GPU 메모리를 갖고 있지 않다. Qwen3-Coder-30B 비교에서 G5와 G6 인스턴스는 각각 4개의 GPU와 96GB의 총 GPU 메모리를 사용하지만, G7 구성은 2개의 GPU와 64GB를 사용한다. AWS는 이 불균형을 테스트의 일부로 제시하며, 더 새로운 인스턴스가 더 적은 가속기와 더 적은 총 메모리를 갖고 있음에도 평가되고 있음을 보여준다.
두 번째 비교도 마찬가지로 불균형하다. G6 설정은 4개의 L4 GPU와 96GB의 총 메모리를, G6e는 4개의 L40S GPU와 192GB를, G7은 2개의 GPU와 64GB를 가진다. 이는 이 실험을 단순한 세대 간 벤치마크보다 실제 운영 선택 문제에 더 가깝게 만든다. 가격 대비 성능에서 이기는 구성이더라도 모델, 가중치, 또는 런타임 상태가 사용 가능한 메모리에 들어가지 않으면 부적합할 수 있다.
AWS는 잠재적인 G7 우위의 배경에 있는 두 가지 하드웨어 특성을 지적한다. 첫째, G7은 NVFP4를 포함한 저정밀 형식을 네이티브로 지원하는 NVIDIA Blackwell GPU를 사용한다. 둘째, 이 아키텍처는 토큰 생성을 개선하도록 설계된 메모리 및 컴퓨팅 기능을 제공한다. AWS에 따르면 다른 테스트 세대도 NVFP4 가중치를 실행할 수 있지만, 동일한 하드웨어 가속은 없다.
MoE 모델의 경우, 각 토큰이 전문가의 일부만 활성화하므로 AWS는 디코딩 중 메모리 대역폭이 특히 중요하다고 주장한다. 이는 데이터 이동과 토큰 간 지연 시간이 모델의 표면상 파라미터 수보다 더 중요해질 수 있음을 의미한다. 실제 결과는 워크로드에 따라 다르다. 저정밀 가속의 이점을 받는 모델은 메모리 용량이나 특정 서빙 프레임워크에 제약되는 모델과 다른 인스턴스 선호를 보일 수 있다.
현재 उपलब्ध한 증거는 AWS의 자체 기술 게시물과 안내 자료에서 나온 것이다. AWS는 G7 테스트가 처리량, 지연 시간, 토큰당 비용에서 측정 가능한 개선을 보여준다고 말하며, G7을 테스트된 사용 사례에서 잠재적 가격 대비 성능 리더로 설명한다. 이는 벤더가 보고한 결과이며, 독립 평가도 아니고 여러 클라우드 제공자를 아우르는 벤치마크도 아니다.
제공된 स्रोत 자료에는 원시 수치 결과, 테스트 기간, 요청 분포, 동시성 수준, 지역별 가격, 상세한 토큰당 비용 표가 포함되어 있지 않다. 따라서 얼마나 큰 개선인지, 얼마나 일관되게 나타나는지, 또는 같은 결과가 다른 모델과 트래픽 패턴에도 적용될지 판단할 수 없다.
결과는 선택된 소프트웨어에도 좌우된다. Qwen3-Coder-30B는 DJL Large Model Inference 컨테이너를 통해 평가되며, Nemotron-3-Nano-30B 워크플로는 vLLM과 SageMaker AI의 추천 도구를 사용한다. 배칭, 스케줄링, 양자화, 컨텍스트 길이, 요청 동시성의 변화는 결과를 바꿀 수 있다. 구매자는 AWS의 추천을 프로덕션 결정으로 받아들이기 전에 자신의 프롬프트와 서비스 수준 목표로 테스트를 재현해야 한다.
AWS는 추천 기능이 실제 GPU 인프라에서 후보 구성을 실행하고 측정된 성능을 바탕으로 검증된 배포 준비 제안을 반환한다고 말한다. 그럼에도 이 맥락에서의 “검증됨”은 모델의 품질, 안전성, 또는 비즈니스 적합성에 대한 독립 인증이 아니라 서비스의 벤치마킹 워크플로를 의미한다.
빌더에게 주는 즉각적인 교훈은 GPU 사양서만 보고 하드웨어를 고르기보다 전체 서빙 구성을 벤치마크해야 한다는 점이다. 코딩 어시스턴트를 배포하는 팀은 첫 토큰까지의 시간, 토큰 간 지연 시간, 지속 처리량, 현실적인 동시성 하에서의 비용을 측정해야 한다. 에이전트형 애플리케이션을 만드는 팀은 짧은 프롬프트와 버스트성 트래픽을 배치 요약 서비스와 다르게 고려해야 할 수 있다.
SageMaker AI의 추천 워크플로는 특히 AWS에서 이미 엔드포인트를 관리하는 팀에게 여러 인스턴스 제품군을 시험하는 수작업을 줄여줄 수 있다. 하지만 워크로드를 정확히 정의해야 하는 필요성을 없애지는 못한다. 잘못된 트래픽 프로필이나 최적화 목표는 기술적으로는 유효하지만 프로덕션에 부적합한 추천을 낳을 수 있다.
메모리는 여전히 배포 제약이다. 예시에서 G7의 총 메모리가 더 적다는 점은 FP8이나 NVFP4를 통해 효율적으로 들어가는 모델에는 매력적일 수 있지만, 더 큰 컨텍스트 윈도우, 광범위한 키-값 캐시, 추가 모델 구성 요소가 필요한 배포에는 덜 적합할 수 있다. 용량이 순수한 토큰 경제성보다 더 중요하다면 G6e의 더 큰 메모리 풋프린트가 여전히 더 선호될 수 있다.
기업 구매자에게 이 비교는 이식성 위험도 강조한다. NVIDIA Blackwell 가속의 가치는 지원되는 형식, 모델 구현, 런타임 성숙도에 달려 있다. 모델을 표준화하는 팀은 더 새로운 GPU가 자동으로 전체 서빙 비용을 낮춘다고 가정하지 말고, 선호하는 양자화 경로와 추론 엔진이 하드웨어를 효과적으로 사용하는지 확인해야 한다.
가장 유용한 후속 조치는 AWS가 각 구성별로 처리량, 첫 토큰까지의 시간, 토큰 간 지연 시간, 동시성, 지역별 가격, 토큰당 비용을 포함한 전체 벤치마크 표를 공개하는 것이다. 그런 수치가 있어야 G7의 우위가 광범위한지, 아니면 특정 워크로드 형태에 집중되는지 알 수 있다.
팀들은 G7의 가용성도 주시해야 한다. AWS는 설명된 구성에서 G7이 US East (Ohio)와 US West (Oregon)에서 일반적으로 사용 가능하다고 밝히고 있으며, 이는 지역적 용량과 데이터 거주 요건을 구매 결정의 일부로 만든다.
추가 비교에서는 더 긴 컨텍스트, 다른 배치 크기, 추가 양자화 형식, 그리고 선택된 두 30B MoE 예제 밖의 모델을 테스트해야 한다. 여러 클라우드에 걸친 독립적인 재현은 Blackwell의 우위가 서로 다른 가격 및 소프트웨어 환경에서도 유지되는지 평가하는 데 더 강한 근거를 제공할 것이다.
AWS는 새로운 모델이나 G5 및 G6의 보편적 대체를 발표하는 것이 아니다. 그것은 더 좁지만 중요한 인프라적 주장, 즉 모델과 런타임이 적절한 저정밀 및 메모리 대역폭 이점을 드러낼 때 더 새로운 가속기가 소규모 및 중간 규모 LLM 서빙의 경제성을 바꿀 수 있다는 점을 제시하고 있다.
AI 팀에게 가장 강한 신호는 워크로드별 자동 인스턴스 선택으로의 이동이다. 그러나 공개된 증거는 AWS가 통제하고 있으며 제공된 자료에는 수치 벤치마크 세부 정보가 부족하므로, 구매자는 보고된 G7의 이점을 출발 가설로 취급해야 한다. 실제 운영의 승자는 모델 적합성, 지연 목표, 트래픽 형태, 지역별 가용성, 그리고 전체 추론 스택을 운영하는 비용에 달려 있다.