NVIDIA ha llevado Groq 3 LPX a producción completa junto con Vera Rubin, con el objetivo de una inferencia más rápida y de contexto largo para agentes y proveedores de nube de IA.

NVIDIA afirma que su sistema de inferencia Groq 3 LPX ha entrado en plena producción y se está integrando con la plataforma rack-scale Vera Rubin NVL72. La combinación está diseñada para acelerar la generación de tokens para aplicaciones agénticas, en las que los modelos razonan repetidamente, llaman a herramientas y procesan historiales conversacionales o de tareas cada vez más largos.
El anuncio amplía la estrategia de Vera Rubin de NVIDIA más allá de la computación acelerada de propósito general. La compañía está posicionando las GPU Rubin para el procesamiento de contextos a gran escala, mientras Groq 3 LPX gestiona la decodificación sensible a la latencia, la etapa en la que un modelo genera la salida un token a la vez. Esa división está orientada a proveedores de nube de IA y empresas que buscan agentes más receptivos sin renunciar al rendimiento en despliegues a gran escala.
Según NVIDIA, Groq 3 LPX es un acelerador interactivo de inferencia de IA diseñado para trabajar junto a Vera Rubin NVL72, no para reemplazarlo. La compañía describe la plataforma como una combinación de GPU y LPU, o unidades de procesamiento local, con cada componente asignado a las cargas de trabajo en las que es más eficaz.
La necesidad de esa separación surge del comportamiento de las cargas de trabajo agénticas. Un agente puede generar una respuesta, usar una herramienta externa, recibir nueva información y comenzar otro turno de inferencia. Cada turno puede añadir contexto a la sesión, requiriendo finalmente que el sistema procese decenas o cientos de miles de tokens mientras sigue produciendo una respuesta con rapidez.
NVIDIA afirma que las GPU Rubin pueden gestionar la gran carga de procesamiento de contexto, mientras que Groq 3 LPX está optimizado para el rendimiento de decode. El sistema también puede configurarse para disaggregación prefill-decode, disaggregación attention-FFN y speculative decoding con external drafter. Se trata de técnicas de infraestructura que dividen las tareas de servicio del modelo o usan tokens predichos para mejorar la velocidad de respuesta.
Un despliegue a escala de rack puede incluir 256 aceleradores LP30 conectados mediante enlaces directos chip a chip, según NVIDIA. La documentación para desarrolladores de la compañía describe 128 GB de SRAM combinado entre esos chips y un compilador que planifica el cálculo y la comunicación antes de la ejecución. Ese enfoque determinista está pensado para reducir la sobrecarga de coordinación que puede volverse significativa cuando los modelos se sirven con tamaños de lote pequeños.
Las afirmaciones de rendimiento más sólidas de NVIDIA proceden de un benchmark de Artificial Analysis, lo que significa que son mediciones de terceros citadas por el proveedor y no evidencia independiente de un rendimiento amplio en producción. En el modelo Gemma 4 31B con un contexto de 100.000 tokens, Artificial Analysis midió una velocidad mediana de 3.431 tokens de salida por segundo en Groq 3 LPX, según el blog para desarrolladores de NVIDIA.
El anuncio corporativo de NVIDIA redondea esa cifra a 3.400 tokens de salida por segundo y afirma que el resultado fue cuatro veces más rápido que la plataforma alternativa más cercana. El material de origen no identifica esa plataforma competidora en el anuncio, por lo que la comparación no puede evaluarse de forma independiente con la evidencia disponible.
Un segundo resultado procede de SPEED-Bench, un benchmark de programación que utiliza Gemma 4. NVIDIA informa de una mediana de 4.767 tokens de salida por segundo y de un resultado en el percentil 80 de 5.520 tokens por segundo. Esas cifras describen un modelo, un contexto y una metodología de prueba específicos; no deben tratarse como una medida universal del rendimiento a través de modelos, tamaños de lote, longitudes de contexto o patrones de tráfico de producción.
La explicación técnica ofrecida por NVIDIA es que Groq 3 LPX utiliza comunicación chip a chip programada por el compilador y solapa el movimiento de datos con el cálculo. En la inferencia paralela convencional, distribuir el trabajo entre procesadores puede introducir costes de sincronización y de comunicación colectiva. NVIDIA sostiene que la planificación previa de las transferencias puede eliminar la necesidad de cierta arbitraje en tiempo real, especialmente con tamaños de lote pequeños asociados a un servicio altamente interactivo.
Ninguna de las fuentes ofrece volúmenes de despliegue de clientes, precios, consumo eléctrico, plazos de disponibilidad general para desarrolladores ni utilización de producción verificada de forma independiente. La evidencia confirma las afirmaciones de producto y arquitectura de NVIDIA, pero todavía no demuestra cómo funciona el sistema económicamente en una amplia gama de cargas de trabajo comerciales.
NVIDIA identifica tres socios asociados con la expansión de Vera Rubin. Nebius se describe como la primera nube de IA en adoptar Groq 3 LPX. NVIDIA dice que el hardware se añadirá a la Token Factory de la empresa para que los desarrolladores puedan construir agentes interactivos, sistemas de codificación y otras aplicaciones en tiempo real a escala.
CoreWeave, por su parte, ha desplegado Spectrum-X Multiplane en producción, según NVIDIA. El sistema de red conecta racks Vera Rubin a través de múltiples switches paralelos, con el objetivo declarado de proporcionar comunicación de alto ancho de banda y sin pérdidas en toda la infraestructura de nube de IA.
NVIDIA también afirma que SpaceXAI planea usar CPUs Vera en su arquitectura de IA agéntica de próxima generación. La compañía vincula esas CPUs con orquestación, uso de herramientas, ejecución de código, procesamiento de datos y simulación, incluida una infraestructura que abarca centros de datos terrestres y satélites en órbita. Se trata de un plan declarado, no de evidencia de que tal despliegue ya esté operando a gran escala.
Estas referencias a socios indican que NVIDIA está vendiendo Vera Rubin como una pila completa de fábrica de IA: CPUs para orquestación y trabajo de propósito general, GPU para contexto y cómputo del modelo, aceleradores Groq para decodificación rápida y redes para conectar los componentes. La importancia comercial dependerá de si los clientes pueden desplegar esa pila de forma más eficiente que grupos de aceleradores separados optimizados para distintas etapas de servicio.
Para los creadores de asistentes de programación, agentes de investigación y sistemas de atención al cliente, la latencia de decode la experimentan directamente los usuarios. Una primera respuesta más rápida o una salida intermedia más rápida puede hacer que un flujo de trabajo de varios pasos se sienta más interactivo, especialmente cuando un agente debe realizar muchas llamadas secuenciales.
El contexto largo también cambia la ecuación de infraestructura. Una sesión que reprocesa repetidamente su historial puede consumir una memoria y una capacidad de cálculo sustanciales incluso cuando el modelo en sí no es excepcionalmente grande. El diseño de NVIDIA apunta a esa combinación de grandes cachés key-value, inferencia con lotes pequeños y comunicación frecuente entre procesadores.
La cuestión práctica para las empresas será menos el máximo de tokens por segundo que el rendimiento a nivel de servicio bajo tráfico real. Los compradores deberán evaluar la latencia en distintos niveles de concurrencia, tamaños de contexto y arquitecturas de modelo, así como el coste de mantener utilizada la capacidad de inferencia especializada. Un sistema excepcionalmente rápido para una carga de benchmark puede ser menos atractivo si la demanda es variable o si las aplicaciones requieren modelos y software que aún no están optimizados para la plataforma.
El anuncio también intensifica la competencia en torno a la especialización de la inferencia. NVIDIA está utilizando el alcance de su plataforma más amplia para combinar un acelerador dedicado de baja latencia con sus próximos productos de GPU, CPU y red. Eso podría atraer a proveedores de nube que construyen servicios de inferencia diferenciados, pero también aumenta la complejidad de software y operativa frente a una única arquitectura de acelerador.
La señal de seguimiento más clara será si Nebius expone servicios basados en Groq 3 LPX para desarrolladores y publica rendimiento en producción, precios o información de capacidad. Esos detalles ayudarían a distinguir un anuncio de hardware de una opción de servicio generalmente accesible.
Los clientes también deberían vigilar resultados independientes más allá de Gemma 4 31B y del benchmark de programación informado. Resultados en modelos más grandes y más pequeños, longitudes de contexto variables, usuarios concurrentes y flujos de trabajo agénticos completos ofrecerían una base más sólida para evaluar la plataforma.
La evidencia de despliegue de CoreWeave y SpaceXAI será otro indicador importante. NVIDIA ha confirmado el despliegue de red en producción de CoreWeave y ha descrito los planes de CPU Vera de SpaceXAI, pero las fuentes no proporcionan datos de escala, carga de trabajo o utilización. La eficiencia energética, el soporte de software y la compatibilidad con frameworks de inferencia populares también determinarán si la arquitectura gana adopción fuera de los socios nombrados por NVIDIA.
La noticia de NVIDIA se entiende mejor como un hito de producción e integración de sistemas, no simplemente como el lanzamiento de otro chip de inferencia. La compañía está respondiendo a un problema de servicio específico: los agentes generan largas cadenas de tokens mientras llevan un gran contexto, lo que hace que tanto la latencia de decode como la sobrecarga de interconexión sean comercialmente importantes.
Los resultados informados son prometedores, pero siguen limitados por benchmarks seleccionados por el proveedor y por una evidencia pública de despliegue limitada. Para los equipos de IA, la prueba relevante será si Groq 3 LPX y Vera Rubin ofrecen una latencia predecible y una economía aceptable en sus propias cargas de trabajo agénticas. Si lo hacen, el enfoque integrado de “fábrica de tokens” de NVIDIA podría convertirse en una opción seria para servicios de alta interactividad; si no, los componentes especializados podrían seguir siendo difíciles de justificar pese a las sólidas cifras máximas.