AI News

Nvidia ha lanzado Nemotron 3.5 Lightning, un modelo de razonamiento de pesos abiertos diseñado para hacer que las cargas de trabajo de agentes de IA sean más rápidas y baratas de ejecutar, en lugar de maximizar el rendimiento en cada benchmark de inteligencia.

El modelo combina 31.6 mil millones de parámetros totales con una arquitectura esparsa que activa solo 3.6 mil millones de parámetros por cada token. Según las pruebas de rendimiento reportadas por The Decoder, alcanza casi 670 tokens por segundo en pruebas previas al lanzamiento con los pesos finales NVFP4 de Nvidia, lo que convierte el rendimiento en la característica central del nuevo lanzamiento de Nemotron 3.5.

Ese posicionamiento importa a medida que los desarrolladores pasan de solicitudes ocasionales a chatbots hacia sistemas de agentes que generan largas secuencias de llamadas a herramientas, código y razonamiento intermedio. Para esas cargas de trabajo, la latencia, el uso de hardware y el costo de servicio pueden importar tanto como la puntuación máxima de un modelo en benchmarks.

Una huella activa más pequeña con un contexto de un millón de tokens

Nemotron 3.5 Lightning sucede a Nemotron 3 Nano 30B A3B y conserva el diseño híbrido Mamba-Transformer del modelo anterior. Su recuento total de parámetros es sustancialmente mayor que el número utilizado durante cualquier cálculo individual, una estructura pensada para ofrecer más capacidad sin imponer el costo de cómputo completo de un modelo denso de 31.6 mil millones de parámetros.

Nvidia ofrece el modelo de razonamiento en formatos BF16 y NVFP4. Este último usa pesos de menor precisión para reducir la memoria y el cómputo requeridos para la inferencia. The Decoder informó que NVFP4 obtuvo la misma puntuación que la versión BF16 en el Artificial Analysis Intelligence Index, con solo una pequeña diferencia de calidad según esa evaluación.

El modelo es solo de texto y admite una ventana de contexto de hasta un millón de tokens. Esa capacidad podría ser útil para agentes de programación, flujos de trabajo con muchos documentos y aplicaciones que necesitan mantener un historial extenso de tareas, aunque la longitud del contexto por sí sola no demuestra qué tan eficiente o fiable será un sistema al manejar entradas muy largas.

Los pesos están disponibles bajo la licencia permisiva OpenMDW-1.1 de Nvidia. The Decoder también enumeró acceso sin servidor a través de proveedores como DeepInfra, Fireworks, FriendliAI, CoreWeave, GMI Cloud, Nebius y Crusoe. La disponibilidad en múltiples plataformas de inferencia reduce la barrera para los equipos que quieren probar el modelo sin tener que operar de inmediato su propia infraestructura de Nvidia.

La velocidad es la propuesta de valor; la inteligencia es competitiva, no dominante

Artificial Analysis otorgó a Nemotron 3.5 Lightning una puntuación de 24 en el Intelligence Index, según informó The Decoder. Eso igualó a gpt-oss-120b de OpenAI y quedó por detrás de Nemotron 3 Super de Nvidia, que obtuvo 26. El resultado supuso una mejora de nueve puntos frente a la puntuación reportada de 15 de Nemotron 3 Nano.

La comparación también muestra los límites del enfoque de Nvidia. The Decoder informó puntuaciones más altas para Qwen3.6 35B A3B y Muse Glimmer de Meta, con 32 y 35 respectivamente. Los sistemas propietarios siguieron por delante en el equilibrio combinado entre velocidad e inteligencia en el análisis citado: Gemini 3.5 Flash-Lite de Google supuestamente obtuvo 37, mientras que GPT-5.6 Luna alcanzó 52.

Los resultados más fuertes reportados de Lightning aparecieron en pruebas orientadas a agentes. En GDPval-AA v2, Artificial Analysis registró una puntuación Elo de 824, frente a 800 para gpt-oss-120b y 698 para Nemotron 3 Super. En Terminal-Bench v2.1, la puntuación del modelo subió del 7 por ciento de su predecesor a 24.3 por ciento, cerca del 26.2 por ciento reportado de gpt-oss-120b.

Estas cifras provienen de una plataforma independiente de pruebas de rendimiento, pero se presentan a través de la cobertura de The Decoder, no como un conjunto completo de resultados reproducidos de forma independiente en la evidencia proporcionada. Por lo tanto, deben tratarse como instantáneas de benchmarks y no como prueba de que Lightning superará a modelos más grandes en cargas de trabajo de producción. La velocidad de inferencia puede variar significativamente según el hardware, el tamaño del lote, la cuantización, el software de servicio, la longitud del prompt y la longitud de la salida.

La cifra principal de rendimiento también procede de pruebas previas al lanzamiento usando pesos finales NVFP4. The Decoder dijo que Lightning completó una tarea de Intelligence Index en aproximadamente medio minuto, frente a unos 3.5 minutos para Qwen3.6 35B A3B y 5.8 minutos para Gemma 4 31B en la comparación citada. Esos tiempos ayudan a aclarar el objetivo de Nvidia: tareas repetidas y sensibles a la latencia donde el costo de esperar o de servir un modelo más grande se acumula a lo largo de muchas interacciones.

Qué significa el lanzamiento para los desarrolladores de IA

Para los equipos de producto, Lightning ofrece una posible capa intermedia entre modelos pequeños y económicos y sistemas grandes reservados para razonamientos difíciles. Una empresa podría usarlo para pasos rutinarios de agentes—clasificación, selección de herramientas, navegación de código, recuperación de documentos o ejecución estructurada—mientras escala los casos ambiguos o de alto riesgo a un modelo más capaz.

Esa arquitectura puede reducir el número de solicitudes enviadas a APIs propietarias costosas, pero solo si el modelo más pequeño funciona de forma fiable en el flujo de trabajo específico. Una ventaja en Terminal-Bench no se traduce automáticamente en cambios de bases de datos fiables, análisis financiero, acciones de atención al cliente o código en producción. Los equipos deberán probar la recuperación ante fallos, la precisión en el uso de herramientas, las tasas de alucinación y la frecuencia con la que las tareas requieren escalado.

El diseño esparso y la opción NVFP4 también pueden afectar la economía del despliegue. Activar 3.6 mil millones de parámetros por paso puede reducir la demanda de cómputo frente a un modelo denso de tamaño total similar, mientras que la cuantización puede bajar los requisitos de memoria. El beneficio práctico dependerá de si un equipo dispone de hardware e infraestructura de servicio compatibles, así como de cuánto sobrecoste introduzcan los contextos largos, el batching y la orquestación de agentes.

La estrategia más amplia de Nvidia se ve reflejada en este lanzamiento. La compañía ha sostenido previamente que modelos por debajo de 10 mil millones de parámetros activos pueden manejar muchas tareas de agentes a una fracción del costo de sistemas mucho más grandes. Lightning convierte ese argumento de eficiencia en un producto con un diseño de estilo mezcla de 31.6 mil millones de parámetros, pero con una vía activa de 3.6 mil millones.

El lanzamiento relacionado de Fastino Labs proporciona una señal temprana sobre un posible uso posterior. StreetInsider informó que la compañía lanzó modelos especializados de pesos abiertos para finanzas y salud, postentrenados sobre Nemotron 3.5 Lightning totalmente mediante un agente. La fuente proporcionada no ofrece detalles técnicos, resultados de evaluación ni cifras de adopción para esos modelos, por lo que el anuncio se entiende mejor como un ejemplo de actividad del ecosistema y no como evidencia de demanda a escala de producción.

Qué vigilar a continuación

El seguimiento más importante será la prueba independiente de la fiabilidad de los agentes de extremo a extremo. Los desarrolladores deberían buscar evaluaciones que midan tareas completadas, no solo rendimiento en tokens o puntuaciones de benchmark, en programación, navegación web, software empresarial y flujos de trabajo de larga duración.

La economía del servicio será otra señal clave. Los despliegues públicos pueden mostrar si NVFP4 y la activación esparsa producen ahorros significativos en cargas de trabajo reales, especialmente cuando los modelos deben manejar contextos grandes o muchos usuarios concurrentes. La brecha de rendimiento entre el despliegue local y la inferencia alojada también importará para las empresas que sopesan el control frente a la simplicidad operativa.

Las asociaciones de postentrenamiento de Nvidia también merecen seguimiento. Artificial Analysis informó que CodeRabbit y Harvey trabajaron con Nvidia en postentrenamiento específico de dominio. Variantes más especializadas podrían determinar si Lightning se convierte en un modelo de agente de propósito general o en una base para sistemas estrechos de alto volumen.

Por último, los compradores deberían seguir la claridad de la licencia, el soporte de herramientas y el comportamiento del modelo bajo restricciones de seguridad. Un modelo de pesos abiertos es más fácil de inspeccionar y desplegar que una API cerrada, pero las organizaciones siguen siendo responsables de la supervisión, los controles de acceso, el manejo de datos y la contención de fallos.

Perspectiva de Creati.ai

Nemotron 3.5 Lightning no es el intento de Nvidia de ganar la clasificación de inteligencia bruta. Es una apuesta a que muchos agentes de IA útiles necesitan una ejecución rápida y repetible más que la mejor respuesta posible en cada tarea.

Eso hace que el lanzamiento sea estratégicamente relevante incluso donde los líderes de benchmarks siguen por delante. Si el rendimiento reportado se mantiene en configuraciones de despliegue comunes, Lightning podría ofrecer a los desarrolladores una opción práctica de enrutamiento para pasos de agente de alto volumen. Su éxito se medirá al final menos por el número de parámetros que por si los equipos pueden completar flujos de trabajo reales con menor latencia y costo sin añadir riesgos inaceptables de fiabilidad o seguridad.

Destacados

Nemotron 3.5 Lightning de Nvidia apuesta por agentes de IA rápidos y eficientes

Nemotron 3.5 Lightning de Nvidia usa activación esparsa y cuantización para ofrecer inferencia abierta rápida, orientada a agentes de IA de alto volumen más que a puntuaciones máximas.