AWS проводит бенчмарк 30B MoE-моделей на SageMaker AI между G5, G6, G6e и G7, показывая, как Blackwell может улучшить стоимость и задержку инференса.

Amazon Web Services использует две Mixture-of-Experts-модели с 30 миллиардами параметров, чтобы сравнить поколения GPU для промышленного инференса на Amazon SageMaker AI. Бенчмарк компании рассматривает конфигурации G5, G6, G6e и новую G7 по показателям пропускной способности, задержки и стоимости за токен, при этом AWS сообщает, что инстансы G7 на базе NVIDIA Blackwell могут обеспечивать лучшее соотношение цены и производительности для выбранных задач.
Этот бенчмарк важен, потому что один лишь размер модели не определяет экономику обслуживания. Квантование, пропускная способность памяти, маршрутизация экспертов и стек программного обеспечения для serving могут менять то, какой инстанс окажется самым практичным выбором. Поэтому результаты AWS, опубликованные в Machine Learning Blog, лучше рассматривать как исследование развертывания, а не как универсальный рейтинг семейств GPU.
AWS тестировала Qwen3-Coder-30B-A3B-Instruct-FP8 для сценариев программирования, включая генерацию кода, отладку, рефакторинг и copilot для разработчиков. В этом эксперименте сравниваются инстансы ml.g5.12xlarge с GPU NVIDIA A10G, инстансы ml.g6.12xlarge с GPU NVIDIA L4 и инстансы ml.g7.12xlarge с GPU RTX PRO 4500 Blackwell. В тесте используется контейнер SageMaker AI DJL Large Model Inference.
Во втором сценарии компания использует NVIDIA Nemotron-3-Nano-30B-A3B-NVFP4 для задач рассуждения, вопросов и ответов, суммаризации и агентных нагрузок. Вместо простого развертывания фиксированных endpoint AWS использует SageMaker AI Generative AI Inference Recommendations с vLLM, чтобы оценить варианты G6, G6e и G7 и определить конфигурацию на основе выбранной цели оптимизации.
Это различие важно. Тест Qwen3-Coder-30B представляет собой прямое сравнение развернутых endpoint под ожидаемой программной нагрузкой. Эксперимент с Nemotron-3-Nano-30B представляет собой автоматизированный процесс рекомендаций, в котором SageMaker AI оценивает кандидатов и ранжирует их по таким метрикам, как стоимость, задержка и пропускная способность.
Конфигурации не содержат одинакового объема GPU-памяти. В сравнении с Qwen3-Coder-30B инстансы G5 и G6 используют по четыре GPU с 96 ГБ суммарной GPU-памяти, тогда как конфигурация G7 использует две GPU с 64 ГБ. AWS представляет этот дисбаланс как часть теста: более новый инстанс оценивается, несмотря на меньшее число ускорителей и меньший общий объем памяти.
Второе сравнение также неравномерно. Конфигурация G6 имеет четыре GPU L4 и 96 ГБ суммарной памяти, G6e — четыре GPU L40S и 192 ГБ, а G7 — две GPU с 64 ГБ. Это делает эксперимент ближе к задаче выбора для производства, чем к простому сравнению поколений. Конфигурация, выигрывающая по соотношению цена-производительность, всё равно может оказаться непригодной, если модель, веса или состояние рантайма не помещаются в доступную память.
AWS указывает на две аппаратные особенности, лежащие в основе потенциального преимущества G7. Во-первых, G7 использует GPU NVIDIA Blackwell, которые обеспечивают нативную поддержку низкопочтенных форматов, включая NVFP4. Во-вторых, архитектура предлагает возможности памяти и вычислений, призванные улучшить генерацию токенов. AWS говорит, что другие тестируемые поколения также могут запускать веса NVFP4, но без такой же аппаратной ускоренности.
Для MoE-моделей AWS утверждает, что пропускная способность памяти особенно важна во время декодирования, потому что каждый токен активирует лишь часть экспертов. Это может сделать передачу данных и межтокенную задержку важнее, чем номинальное число параметров модели. Практический результат зависит от нагрузки: модель, выигрывающая от ускорения на низкой точности, может предпочесть другой инстанс, чем модель, ограниченная объемом памяти или конкретным фреймворком serving.
Доступные доказательства исходят из собственного технического материала AWS и пошаговых разборов. AWS заявляет, что тесты G7 показывают измеримые улучшения пропускной способности, задержки и стоимости за токен, и описывает G7 как потенциального лидера по соотношению цена-производительность для протестированных сценариев. Это результаты, сообщенные поставщиком, а не независимая оценка и не бенчмарк, проведенный по нескольким облачным провайдерам.
В предоставленных исходных материалах нет базовых числовых результатов, продолжительности тестов, распределения запросов, уровней параллелизма, региональных цен и детализированных таблиц стоимости за токен. Поэтому нельзя установить, насколько велики выигрыши, насколько стабильно они проявляются или применим ли тот же результат к другим моделям и шаблонам трафика.
Результаты также зависят от выбранного ПО. Qwen3-Coder-30B оценивается через контейнер DJL Large Model Inference, тогда как рабочий процесс Nemotron-3-Nano-30B использует vLLM и инструмент рекомендаций SageMaker AI. Изменения в batching, планировании, квантовании, длине контекста или параллелизме запросов могут изменить итог. Покупателям следует воспроизвести тест на своих промптах и SLA-целях, прежде чем рассматривать рекомендацию AWS как решение для production.
AWS говорит, что функция рекомендаций запускает кандидатные конфигурации на реальной GPU-инфраструктуре и возвращает проверенные, готовые к развертыванию предложения на основе измеренной производительности. Тем не менее, «проверенные» в данном контексте относится к бенчмаркинговому workflow сервиса, а не к независимой сертификации качества, безопасности или бизнес-пригодности модели.
Для разработчиков главный вывод в том, чтобы бенчмаркать всю конфигурацию serving, а не выбирать железо только по спецификации GPU. Команда, разворачивающая кодового ассистента, должна измерять время до первого токена, межтокенную задержку, устойчивую пропускную способность и стоимость при реалистичном уровне параллелизма. Команде, создающей агентное приложение, возможно, придется по-другому взвешивать короткие промпты и всплесковый трафик, чем службу пакетной суммаризации.
Рабочий процесс рекомендаций SageMaker AI может сократить ручную работу по тестированию нескольких семейств инстансов, особенно для команд, уже управляющих endpoint в AWS. Однако он не устраняет необходимость точно определить нагрузку. Неверный профиль трафика или цель оптимизации могут привести к технически корректной, но плохо подходящей для production рекомендации.
Память по-прежнему остается ограничением развертывания. Более низкий суммарный объем памяти G7 в примерах может делать её привлекательной для моделей, которые эффективно помещаются в FP8 или NVFP4, но менее подходящей для развертываний, требующих больших окон контекста, обширных key-value кэшей или дополнительных компонентов модели. Более крупный объем памяти G6e может оставаться предпочтительным, когда емкость важнее, чем чистая экономика токенов.
Для корпоративных покупателей сравнение также подчеркивает риск переносимости. Ценность ускорения NVIDIA Blackwell зависит от поддерживаемых форматов, реализаций моделей и зрелости runtime. Командам, стандартизующим модель, следует проверить, что предпочитаемый путь квантования и движок инференса эффективно используют железо, а не предполагать, что более новый GPU автоматически снижает общую стоимость serving.
Самым полезным шагом было бы, если бы AWS опубликовала полные таблицы бенчмарка, включая пропускную способность, время до первого токена, межтокенную задержку, параллелизм, региональные цены и стоимость за токен для каждой конфигурации. Эти данные показали бы, является ли преимущество G7 широким или сосредоточенным в определенных формах нагрузки.
Командам также следует следить за доступностью G7. AWS отмечает, что G7 в описанной конфигурации в целом доступна в US East (Ohio) и US West (Oregon), что делает региональные мощности и требования к размещению данных частью решения о покупке.
Дальнейшие сравнения должны тестировать более длинные контексты, разные размеры батчей, дополнительные форматы квантования и модели вне двух выбранных 30B MoE-примеров. Независимое воспроизведение в разных облаках дало бы более прочную основу для оценки того, сохраняется ли преимущество Blackwell в различных ценовых и программных средах.
AWS не анонсирует новую модель и не предлагает универсальную замену G5 и G6. Компания выдвигает более узкий, но важный инфраструктурный тезис: новые ускорители могут изменить экономику serving для малых и средних LLM, когда модель и runtime раскрывают нужные преимущества низкой точности и пропускной способности памяти.
Самый сильный сигнал для AI-команд — это переход к автоматизированному, специфичному для нагрузки выбору инстансов. Но поскольку опубликованные данные контролируются AWS и не содержат численных деталей бенчмарка в предоставленных материалах, покупателям следует рассматривать заявленные выигрыши G7 как исходную гипотезу. Победитель в production будет зависеть от соответствия модели, целевых задержек, формы трафика, региональной доступности и стоимости эксплуатации всего стека инференса.