
Alibaba ha publicado los pesos abiertos de Qwen3.8-2.4T-A95B, un modelo mixture-of-experts de 2,4 billones de parámetros, mientras que NVIDIA ha publicado una ruta de implementación para ejecutarlo en el sistema GB300 NVL72 a escala de rack de la compañía. El anuncio sitúa un modelo open-weight de gran tamaño en el centro de una pila de hardware y software de serving diseñada para razonamiento de largo contexto y aplicaciones agentivas.
El modelo activa 95.000 millones de parámetros por token en lugar de usar su recuento total de parámetros en cada solicitud. NVIDIA afirma que su implementación inicial en FP8 puede ofrecer más de 4.000 tokens por segundo por GPU y más de 350 tokens por segundo por usuario en GB300 NVL72, aunque esas cifras proceden de las pruebas de infraestructura de NVIDIA y no deben tratarse como benchmarks independientes.
Qwen3.8-2.4T-A95B, también referido en el artículo de NVIDIA como Qwen3.8-Max, está orientado a programación, análisis de documentos a gran escala y cargas de trabajo agentivas de varios pasos. La publicación de Alibaba pone los pesos del modelo a disposición a través de Hugging Face y ModelScope, según NVIDIA.
La arquitectura combina un enrutamiento de mixture-of-experts de grano fino con capas alternas de full-attention y linear-attention. Un enrutador aprendido selecciona los expertos necesarios para cada token, lo que permite que el coste de serving del modelo dependa más de sus parámetros activos que de toda la capacidad de 2,4T parámetros.
El diseño de atención aborda un problema específico en sistemas agentivos: el contexto puede acumular instrucciones del sistema, resultados de herramientas, documentos recuperados, código fuente, registros y razonamiento intermedio durante muchos turnos. NVIDIA afirma que el modelo admite una ventana de contexto de hasta un millón de tokens y una salida de hasta 128K tokens. Sus capas de linear-attention utilizan un estado recurrente acotado en lugar de una caché key-value en crecimiento, mientras que las capas de full-attention conservan una interacción token a token más amplia cuando es necesario.
Esas capacidades son relevantes para los equipos de producto que construyen agentes que deben mantener estado durante flujos de trabajo prolongados. También plantean preguntas prácticas de infraestructura, porque un contexto de un millón de tokens puede desplazar el cuello de botella del cálculo bruto del modelo hacia la capacidad de memoria, la comunicación y la gestión de la caché.
El GB300 NVL72 de NVIDIA integra 72 GPU Blackwell Ultra en una única plataforma a escala de rack. El sistema proporciona un dominio NVLink de 72 GPU con 130 TB/s de comunicación all-to-all, según NVIDIA. Esa interconexión es importante para un gran modelo MoE, porque enrutar solicitudes a expertos a través de redes de servidor convencionales puede introducir sobrecarga de comunicación y una utilización desigual.
Por tanto, servir Qwen3.8-2.4T-A95B depende de más que colocar archivos del modelo en un conjunto de aceleradores. La implementación requiere ejecución distribuida, kernels optimizados y un runtime de inferencia capaz de coordinar el tráfico de expertos a través del rack. El blog de NVIDIA presenta la configuración GB300 como una forma de integrar esa coordinación en el diseño del sistema en lugar de depender únicamente de redes estándar.
NVIDIA afirma que los resultados iniciales reportados se obtuvieron en FP8 sin ajuste adicional del modelo. La compañía espera mejoras adicionales con precisión NVFP4, pero no proporcionó una cifra de rendimiento futura en el anuncio suministrado. La ejecución en FP8 y en precisiones inferiores puede reducir los requisitos de memoria y cómputo, pero los compradores de producción aún tendrán que evaluar la calidad de salida, la estabilidad numérica y el coste operativo de la implementación completa a escala de rack.
Una característica destacada del producto son los controles de razonamiento integrados de Qwen3.8-2.4T-A95B. Según NVIDIA, los desarrolladores pueden seleccionar modos de razonamiento low, high o xhigh por solicitud. Los controles están pensados para permitir que las aplicaciones intercambien profundidad de inferencia por calidad de respuesta y latencia.
Eso es más útil operativamente que tratar el razonamiento como un ajuste global fijo. Un agente de programación que gestione un problema arquitectónico ambiguo podría usar un ajuste más alto, mientras que una canalización de procesamiento de documentos podría reducir la profundidad de razonamiento para maximizar el rendimiento. En sistemas empresariales, la elección también podría vincularse a la prioridad de la tarea, el nivel de usuario o el presupuesto de latencia de una aplicación.
Los controles no eliminan la necesidad de evaluación. Los equipos deberán medir si los ajustes de razonamiento más altos mejoran lo suficiente la finalización de tareas como para justificar el cómputo adicional, y si los ajustes más bajos preservan la precisión en cargas de trabajo repetitivas. El anuncio no ofrece un análisis independiente de las diferencias de calidad entre los tres modos.
La principal evidencia de esta implementación procede de una entrada del NVIDIA Developer Blog, lo que convierte a NVIDIA en la fuente de las cifras de rendimiento, la descripción del sistema y las recomendaciones de serving. Una entrada separada de NVIDIA Developer enlaza con el mismo anuncio, pero no añade información independiente. El material fuente disponible no incluye resultados de benchmarks de terceros, implementaciones de clientes ni adopción verificada en producción.
NVIDIA enumera SGLang, vLLM y NVIDIA Dynamo como opciones de inferencia de código abierto para desarrolladores que buscan controlar el rendimiento del serving. También ofrece NVIDIA NIM, descrito en la publicación como un contenedor de inferencia sin modelo que puede servir modelos compatibles. El flujo de trabajo previsto consiste en descargar los pesos del modelo, desplegarlos mediante el contenedor y escalar el servicio según sea necesario.
Para la personalización, NVIDIA recomienda NVIDIA NeMo AutoModel. La biblioteca de fine-tuning nativa de PyTorch admite el uso directo de checkpoints de Hugging Face, fine-tuning supervisado completo y adaptación basada en LoRA, según la compañía. Esto da a los equipos una posible vía desde el checkpoint público hasta versiones específicas de dominio, pero el tamaño del modelo significa que el entrenamiento, el almacenamiento de checkpoints y la evaluación siguen siendo proyectos de infraestructura sustanciales.
Las cifras de “más de 4K tokens por segundo por GPU” y “más de 350 tokens por segundo por usuario” son especialmente importantes de interpretar con cuidado. NVIDIA las identifica como resultados Day 0 en su propia pila de hardware y software. Indican el objetivo de rendimiento de la receta de implementación, no un resultado universal que deba trasladarse sin cambios a otros servidores, configuraciones de precisión, perfiles de batch o cargas de trabajo de aplicación.
Para los constructores de AI, el anuncio amplía el espacio de diseño open-weight hacia modelos cuya capacidad total se mide en billones de parámetros mientras la activación por token sigue siendo menor. Eso puede favorecer el razonamiento especializado y el comportamiento agentivo sin requerir que un modelo denso de 2,4T ejecute cada parámetro en cada token.
Sin embargo, el umbral de hardware es alto. Una plataforma a escala de rack con 72 GPU no es un entorno de desarrollo típico, y los equipos deberán considerar la utilización, la programación, la replicación del modelo, la recuperación ante fallos y los costes energéticos junto con las cifras de tokens por segundo. El modelo puede ser técnicamente abierto, pero operar a la escala anunciada probablemente quedará concentrado entre empresas bien financiadas, proveedores de cloud y organizaciones de investigación con acceso a infraestructura avanzada.
La implementación también ilustra una división creciente entre la apertura del modelo y la accesibilidad operativa. Los pesos abiertos pueden hacer posibles la experimentación y el fine-tuning, pero el serving de largo contexto y la comunicación MoE a gran escala siguen dependiendo de sistemas especializados. Los compradores que evalúen el modelo deberían comparar el coste extremo a extremo por tarea completada, no solo la velocidad bruta de generación. También deberían probar el uso de herramientas, la recuperación de largo contexto, la fiabilidad en ejecuciones de varios pasos y el comportamiento bajo distintos ajustes de razonamiento.
La señal de seguimiento más clara será la prueba independiente de Qwen3.8-2.4T-A95B en SGLang, vLLM y NVIDIA Dynamo, incluida la latencia, el rendimiento, el uso de memoria y la calidad en cada nivel de razonamiento. Las comparaciones con otros modelos open-weight mostrarán si la arquitectura aporta ventajas prácticas más allá de su recuento de parámetros.
Los desarrolladores también deberían vigilar las optimizaciones NVFP4 prometidas, recetas adicionales de implementación y evidencia de cargas de trabajo reales en producción. La adopción de los pesos del modelo, los checkpoints ajustados y las aplicaciones agentivas de largo contexto será más significativa que la simple actividad de descarga. Por último, el coste y la disponibilidad de sistemas GB300 NVL72 determinarán si esto sigue siendo principalmente una demostración de infraestructura a escala de rack o se convierte en una opción de serving ampliamente utilizable.
El anuncio de NVIDIA es significativo menos porque haga accesible universalmente un modelo de 2,4T parámetros que porque demuestra cómo se están diseñando conjuntamente los pesos abiertos, el enrutamiento MoE, el razonamiento configurable y las interconexiones a escala de rack. La implementación trata la inferencia como un problema de sistemas, donde la comunicación y la memoria se vuelven tan importantes como la aritmética de los aceleradores.
Para los equipos de producto, la cuestión práctica no es si el modelo más grande puede generar tokens rápidamente. Es si sus controles de razonamiento y su arquitectura de largo contexto mejoran suficientemente un flujo de trabajo definido como para justificar una infraestructura especializada. Hasta que aparezcan benchmarks independientes y evidencia de producción, Qwen3.8-2.4T-A95B se ve mejor como un modelo abierto prometedor acompañado de un plano de serving reportado por el proveedor, más que como un valor predeterminado probado para despliegue empresarial.
NVIDIA explica cómo el modelo open-weight Qwen3.8 de Alibaba se ejecuta en GB300 NVL72, con razonamiento configurable para cargas de trabajo agentivas a gran escala.