AI News

NVIDIA says its Groq 3 LPX inference accelerator has entered full production as part of the Vera Rubin platform, giving cloud providers and enterprise infrastructure teams a specialized option for generating tokens quickly in long-context, agent-driven workloads.

The announcement positions Groq 3 LPX as a companion to NVIDIA’s Vera Rubin NVL72 rather than a replacement for its general-purpose GPUs. Rubin GPUs are intended to handle context processing, while the LPX system focuses on the latency-sensitive decode phase in which models produce responses one token at a time. That distinction matters as AI applications move from single-turn answers toward agents that repeatedly reason, call tools, exchange information with other systems and maintain large working contexts.

Un sistema de producción centrado en la latencia de decodificación

NVIDIA describe Groq 3 LPX como un acelerador de inferencia interactiva diseñado para los niveles de servicio con mayor capacidad de respuesta de su arquitectura Vera Rubin. Una implementación a escala de rack puede incluir 256 aceleradores LP30 conectados mediante enlaces directos chip a chip, con 128 GB de memoria combinada basada en SRAM, según la documentación para desarrolladores de NVIDIA.

El sistema utiliza un modelo de ejecución determinista y planificado por el compilador. En lugar de depender tanto de la arbitraje en tiempo real para decidir cuándo se mueve la información entre procesadores, el compilador puede planificar la computación y la comunicación antes de que comience una carga de trabajo. NVIDIA afirma que esto reduce la sobrecarga de coordinación que puede volver menos útil el paralelismo de tensores en tamaños de lote muy pequeños.

Ese diseño apunta a una debilidad específica en el servicio de IA agéntica. Un agente puede necesitar generar muchas salidas breves durante una sola tarea, y cada respuesta desencadena otra llamada a una herramienta, un turno del modelo o una operación de base de datos. Pequeños retrasos en la generación de tokens pueden acumularse a lo largo de esos pasos. Las sesiones largas también vuelven a alimentar repetidamente un contexto en expansión al modelo, lo que dificulta la capacidad de respuesta incluso cuando el modelo subyacente es capaz.

La arquitectura de NVIDIA separa el trabajo entre la plataforma. La Vera Rubin NVL72 maneja el procesamiento de contexto a gran escala, mientras que Groq 3 LPX acelera la generación de tokens. La empresa dice que ambos sistemas también pueden admitir configuraciones como la desagregación prefill-decode, la desagregación attention-FFN y la decodificación especulativa con un redactor externo.

Lo que muestran las pruebas de referencia

NVIDIA informa que un sistema que combina Groq 3 LPX con Vera Rubin NVL72 alcanzó 3.431 tokens de salida por segundo en el benchmark de 100K-contexto de Artificial Analysis utilizando Gemma 4 31B. Un anuncio separado de NVIDIA redondeó el resultado a 3.400 tokens por segundo y dijo que era cuatro veces más rápido que la plataforma alternativa más cercana.

Estas son las afirmaciones de rendimiento más sólidas en la evidencia disponible, y requieren matización. NVIDIA informa el resultado del benchmark a partir de Artificial Analysis, mientras que la afirmación comparativa de “cuatro veces más rápido” también proviene de NVIDIA. La publicación para desarrolladores lo llama el primer benchmark de terceros de los sistemas Groq 3 LPX, pero las fuentes proporcionadas no ofrecen la configuración completa de las pruebas, las plataformas competidoras ni resultados reproducidos de forma independiente.

NVIDIA también cita un resultado mediano de 4.767 tokens de salida por segundo en SPEED-Bench en cargas de trabajo generales agénticas y de codificación. Esa cifra también se presenta en el material para desarrolladores de NVIDIA. No debe tomarse como una tasa de servicio universal: el rendimiento real dependerá de la arquitectura del modelo, la longitud del contexto, la concurrencia, la programación, la precisión, la red y la pila de software circundante.

Aun así, el enfoque de los benchmarks es significativo. Las comparaciones convencionales de aceleradores suelen poner el énfasis en el rendimiento agregado o la velocidad de entrenamiento. NVIDIA, en cambio, destaca la tasa de salida con 100.000 tokens de contexto y en tamaños de lote bajos, condiciones que se parecen más a los agentes interactivos que a la inferencia masiva fuera de línea. Para los equipos de producto, eso puede ser una medida más relevante cuando los usuarios esperan a que un agente complete una cadena de acciones.

Las señales de despliegue inicial siguen viniendo del proveedor

NVIDIA identifica a Nebius como el primer proveedor de nube de IA en adoptar Groq 3 LPX. La empresa dice que Nebius añadirá el acelerador a su servicio Token Factory, permitiendo a los desarrolladores crear agentes interactivos, sistemas de codificación y otras aplicaciones en tiempo real a escala. La evidencia no especifica el tamaño del despliegue de Nebius, la fecha de disponibilidad comercial ni los compromisos de clientes.

NVIDIA también dice que CoreWeave ha desplegado Spectrum-X Multiplane en producción para conectar racks Vera Rubin a través de múltiples conmutadores paralelos. Ese anuncio se refiere a la capa de red alrededor de la plataforma, no a una prueba de que CoreWeave haya desplegado Groq 3 LPX en sí.

Una tercera señal de adopción proviene de SpaceXAI, que según NVIDIA planea usar CPUs Vera en su arquitectura de IA agéntica de próxima generación. Los casos de uso mencionados incluyen orquestación, uso de herramientas, ejecución de código, procesamiento de datos y simulación, con despliegues en centros de datos y satélites orbitales. Se trata de un plan de la empresa informado por NVIDIA, no de evidencia de una implementación de producción completada.

Dado que la cobertura disponible está dominada por el blog propio de NVIDIA y por materiales para desarrolladores, la adopción debe considerarse actividad del ecosistema anunciada y no tracción de mercado verificada de forma independiente. La entrada de fuente de SiliconANGLE confirma el ángulo de la noticia, pero no proporciona texto adicional del artículo ni detalles de la cobertura en la evidencia suministrada.

Por qué el hardware importa para quienes construyen IA

Para los desarrolladores de aplicaciones de IA, la pregunta más inmediata no es si Groq 3 LPX tiene una alta tasa máxima de tokens. Es si la plataforma puede ofrecer una latencia predecible cuando un agente opera a lo largo de muchos turnos y una ventana de contexto grande.

Eso podría hacer que el sistema sea relevante para asistentes de programación, agentes de investigación, flujos de trabajo de atención al cliente y sistemas de orquestación en los que un usuario percibe el retraso de cada respuesta intermedia del modelo. Una decodificación más rápida puede mejorar la capacidad de respuesta percibida, mientras que la programación determinista puede facilitar la planificación de capacidad si el rendimiento es menos sensible a la contención y a los costos de coordinación de lotes pequeños.

La contrapartida es la complejidad arquitectónica. Groq 3 LPX se presenta como una extensión de Vera Rubin NVL72, no como un acelerador de reemplazo directo que pueda evaluarse de forma independiente respecto a la plataforma anfitriona, su interconexión, el compilador y el software de servicio del modelo. Los compradores tendrán que evaluar el sistema completo: capacidad de memoria para contextos largos, topología de red, compatibilidad con modelos, utilización bajo el tráfico esperado y el costo de mover cargas de trabajo entre recursos de prefill y decode.

La propuesta de NVIDIA también refleja un cambio más amplio en la economía de la infraestructura. A medida que los agentes generan más tokens y realizan más turnos de inferencia, el costo de servicio y la latencia pueden convertirse en restricciones mayores que la factura inicial de entrenamiento del modelo. Un motor de decodificación especializado puede mejorar la utilización para cargas de trabajo interactivas, pero si reduce el costo total depende de cuán consistentemente un proveedor pueda mantener ocupados tanto las GPUs Rubin como los aceleradores LPX.

Qué vigilar a continuación

Las próximas señales útiles vendrán de pruebas independientes que publiquen configuraciones completas, sistemas competidores, versiones de modelo, ajustes de precisión, longitudes de contexto y niveles de concurrencia. Los resultados en varios tamaños de lote ayudarán a establecer si la ventaja de Groq 3 LPX va más allá del servicio altamente interactivo de lotes pequeños.

Los desarrolladores también deberían vigilar evidencia de disponibilidad en producción a través de Nebius Token Factory, incluidos los modelos admitidos, los precios, las garantías de nivel de servicio y si los clientes pueden acceder al sistema sin adoptar la pila más amplia de Vera Rubin. Los despliegues confirmados en CoreWeave u otros proveedores de nube ofrecerían una medida más clara de la tracción comercial.

Por último, el mercado tendrá que ver cómo NVIDIA integra el compilador, la red y el software de servicio con los marcos de agentes comunes. La promesa técnica depende de coordinar la ejecución del modelo, la gestión de la caché KV, las llamadas a herramientas y el tráfico multiagente, no solo de acelerar pasos de decodificación aislados.

Perspectiva de Creati.ai

Groq 3 LPX es notable porque NVIDIA está apuntando a un cuello de botella que solo se hace visible cuando los modelos se colocan dentro de bucles de agentes extendidos: el retraso acumulado de producir muchos tokens secuenciales mientras se conserva un gran contexto. El anuncio trata menos de un lanzamiento de chip independiente que de la división de la inferencia en etapas especializadas a través de un sistema a escala de rack.

La oportunidad es sustancial para los proveedores que sirven agentes interactivos, pero la evidencia sigue estando controlada principalmente por el proveedor. Hasta que los benchmarks independientes y los despliegues de clientes aclaren el costo total, los requisitos de software y el rendimiento sostenido bajo cargas de trabajo reales, Groq 3 LPX debe considerarse una oferta de producción de enfoque técnico con un impacto de mercado prometedor, pero aún no plenamente validado.

Destacados

NVIDIA pone Groq 3 LPX en producción completa para la inferencia de IA de contexto largo

NVIDIA dice que Groq 3 LPX está en producción completa con Vera Rubin, con el objetivo de acelerar la inferencia de contexto largo para agentes de IA y cargas de trabajo de múltiples turnos.