AWS compara las GPU Blackwell G7 con G5 y G6 para la inferencia de pequeños LLM

AWS compara modelos MoE de 30B en SageMaker AI entre G5, G6, G6e y G7, mostrando cómo Blackwell podría mejorar el coste y la latencia de inferencia.

AI News

Amazon Web Services está utilizando dos modelos Mixture-of-Experts de 30 mil millones de parámetros para comparar generaciones de GPU para la inferencia en producción en Amazon SageMaker AI. El benchmark de la compañía examina configuraciones G5, G6, G6e y la nueva G7 en términos de rendimiento, latencia y coste por token, y AWS informa que las instancias G7 impulsadas por NVIDIA Blackwell pueden ofrecer una mejor relación precio-rendimiento para determinadas cargas de trabajo.

El benchmark es importante porque el tamaño del modelo por sí solo no determina la economía de la prestación. La cuantización, el ancho de banda de memoria, el enrutamiento de expertos y la pila de software de serving pueden cambiar qué instancia resulta la opción más práctica. Por ello, los resultados de AWS, publicados en su Machine Learning Blog, se leen mejor como un estudio de despliegue que como una clasificación universal de familias de GPU.

Dos modelos, dos rutas de evaluación

AWS probó Qwen3-Coder-30B-A3B-Instruct-FP8 para casos de uso de programación, incluida la generación de código, depuración, refactorización y copilotos para desarrolladores. Ese experimento compara instancias ml.g5.12xlarge con GPUs NVIDIA A10G, instancias ml.g6.12xlarge con GPUs NVIDIA L4 y instancias ml.g7.12xlarge con GPUs RTX PRO 4500 Blackwell. La prueba utiliza el contenedor SageMaker AI DJL Large Model Inference.

El segundo escenario de la compañía usa NVIDIA Nemotron-3-Nano-30B-A3B-NVFP4 para razonamiento, preguntas y respuestas, resumen y cargas de trabajo agénticas. En lugar de desplegar solo endpoints fijos, AWS utiliza SageMaker AI Generative AI Inference Recommendations con vLLM para evaluar opciones G6, G6e y G7 e identificar una configuración basada en un objetivo de optimización seleccionado.

Esa distinción es importante. La prueba de Qwen3-Coder-30B representa una comparación directa de endpoints desplegados bajo una carga de trabajo de programación esperada. El ejercicio con Nemotron-3-Nano-30B representa un proceso de recomendación automatizado en el que SageMaker AI evalúa configuraciones candidatas y las clasifica según métricas como coste, latencia y rendimiento.

Por qué G7 puede cambiar la comparación

Las configuraciones no contienen cantidades equivalentes de memoria GPU. Para la comparación con Qwen3-Coder-30B, las instancias G5 y G6 utilizan cada una cuatro GPUs con 96 GB de memoria GPU agregada, mientras que la configuración G7 utiliza dos GPUs con 64 GB. AWS presenta ese desequilibrio como parte de la prueba: la instancia más nueva se evalúa a pesar de tener menos aceleradores y menos memoria total.

La segunda comparación también es desigual. La configuración G6 tiene cuatro GPUs L4 y 96 GB de memoria agregada, G6e tiene cuatro GPUs L40S y 192 GB, y G7 tiene dos GPUs con 64 GB. Esto hace que el ejercicio se parezca más a un problema de selección para producción que a un simple benchmark generación contra generación. Una configuración que gane en relación precio-rendimiento aún puede resultar inadecuada si el modelo, los pesos o el estado en tiempo de ejecución no caben en la memoria disponible.

AWS apunta a dos características de hardware detrás de la posible ventaja de G7. Primero, G7 usa GPUs NVIDIA Blackwell, que ofrecen compatibilidad nativa con formatos de baja precisión, incluido NVFP4. Segundo, la arquitectura proporciona capacidades de memoria y cómputo destinadas a mejorar la generación de tokens. AWS dice que las otras generaciones probadas pueden ejecutar pesos NVFP4, pero sin la misma aceleración de hardware.

Para los modelos MoE, AWS sostiene que el ancho de banda de memoria es especialmente relevante durante la decodificación porque cada token activa solo un subconjunto de expertos. Esto puede hacer que el movimiento de datos y la latencia entre tokens sean más importantes que el número principal de parámetros del modelo. El resultado práctico depende de la carga de trabajo: un modelo que se beneficia de la aceleración de baja precisión puede mostrar una preferencia de instancia distinta de uno limitado por la capacidad de memoria o por un marco de serving concreto.

Evidencia y límites de las afirmaciones

La evidencia disponible proviene del propio artículo técnico de AWS y de sus guías paso a paso. AWS afirma que las pruebas con G7 muestran mejoras medibles en rendimiento, latencia y coste por token, y describe a G7 como un posible líder en relación precio-rendimiento para los casos de uso evaluados. Son hallazgos reportados por el proveedor, no una evaluación independiente ni un benchmark realizado entre múltiples proveedores de nube.

El material fuente proporcionado no incluye los resultados numéricos subyacentes, la duración de las pruebas, la distribución de las solicitudes, los niveles de concurrencia, los precios regionales ni tablas detalladas de coste por token. Por tanto, no puede establecer cuán grandes son las ganancias, con qué consistencia aparecen ni si el mismo resultado se aplicaría a otros modelos y patrones de tráfico.

Los resultados también están condicionados por el software elegido. Qwen3-Coder-30B se evalúa mediante el contenedor DJL Large Model Inference, mientras que el flujo de trabajo de Nemotron-3-Nano-30B utiliza vLLM y la herramienta de recomendaciones de SageMaker AI. Los cambios en batching, programación, cuantización, longitud de contexto o concurrencia de solicitudes podrían alterar el resultado. Los compradores deberían reproducir la prueba con sus propios prompts y objetivos de nivel de servicio antes de tratar la recomendación de AWS como una decisión de producción.

AWS dice que la función de recomendación ejecuta configuraciones candidatas sobre infraestructura GPU real y devuelve sugerencias validadas y listas para desplegar basadas en el rendimiento medido. Aun así, “validado” en este contexto se refiere al flujo de trabajo de benchmarking del servicio, no a una certificación independiente de la calidad, seguridad o idoneidad comercial del modelo.

Qué significa el benchmark para los equipos de IA

Para los desarrolladores, la lección inmediata es comparar el conjunto completo de serving en lugar de elegir hardware a partir de una hoja de especificaciones de GPU. Un equipo que despliegue un asistente de programación debería medir el tiempo hasta el primer token, la latencia entre tokens, el rendimiento sostenido y el coste bajo una concurrencia realista. Un equipo que construya una aplicación agéntica puede necesitar ponderar de forma distinta los prompts cortos y el tráfico en ráfagas frente a un servicio de resumido por lotes.

El flujo de trabajo de recomendaciones de SageMaker AI podría reducir el trabajo manual que implica probar varias familias de instancias, especialmente para los equipos que ya gestionan endpoints en AWS. Sin embargo, no elimina la necesidad de definir con precisión la carga de trabajo. Un perfil de tráfico o un objetivo de optimización incorrectos pueden producir una recomendación técnicamente válida pero mal alineada con la producción.

La memoria sigue siendo una restricción de despliegue. La menor memoria agregada de G7 en los ejemplos puede hacerla atractiva para modelos que encajan eficientemente mediante FP8 o NVFP4, pero menos adecuada para despliegues que requieren ventanas de contexto más amplias, extensas cachés key-value o componentes adicionales del modelo. El mayor espacio de memoria de G6e puede seguir siendo preferible cuando la capacidad importa más que la economía bruta por token.

Para los compradores empresariales, la comparación también destaca el riesgo de portabilidad. El valor de la aceleración NVIDIA Blackwell depende de los formatos compatibles, las implementaciones de modelos y la madurez del runtime. Los equipos que estandaricen un modelo deben verificar que su ruta de cuantización preferida y su motor de inferencia utilicen el hardware de forma efectiva, en lugar de asumir que una GPU más nueva reduce automáticamente el coste total de serving.

Qué vigilar a continuación

Lo más útil sería que AWS publicara las tablas completas del benchmark, incluyendo rendimiento, tiempo hasta el primer token, latencia entre tokens, concurrencia, precios regionales y coste por token para cada configuración. Esas cifras mostrarían si la ventaja de G7 es amplia o está concentrada en formas concretas de carga de trabajo.

Los equipos también deberían vigilar la disponibilidad de G7. AWS señala que G7 está generalmente disponible en US East (Ohio) y US West (Oregon) en la configuración descrita, lo que convierte la capacidad regional y los requisitos de residencia de datos en parte de la decisión de compra.

Las comparaciones futuras deberían probar contextos más largos, distintos tamaños de lote, formatos adicionales de cuantización y modelos fuera de los dos ejemplos MoE de 30B seleccionados. La replicación independiente entre nubes proporcionaría una base más sólida para evaluar si la ventaja de Blackwell sobrevive a distintos entornos de precios y software.

Perspectiva de Creati.ai

AWS no está anunciando un nuevo modelo ni un reemplazo universal para G5 y G6. Está presentando un argumento de infraestructura más limitado pero importante: los aceleradores más nuevos pueden cambiar la economía del serving de LLM pequeños y medianos cuando el modelo y el runtime exponen las ventajas adecuadas de baja precisión y ancho de banda de memoria.

La señal más fuerte para los equipos de IA es el movimiento hacia la selección automatizada de instancias específica para la carga de trabajo. Pero como la evidencia publicada está controlada por AWS y carece de los detalles numéricos del benchmark en el material proporcionado, los compradores deberían tratar las ganancias reportadas de G7 como una hipótesis inicial. El ganador en producción dependerá del ajuste del modelo, los objetivos de latencia, la forma del tráfico, la disponibilidad regional y el coste de operar toda la pila de inferencia.

Anuncios