AI News

NVIDIA ha presentado Nemotron 3.5 Lightning, un modelo de mezcla de expertos de 30 mil millones de parámetros, junto con NeMo Switchyard, una biblioteca de código abierto para enrutar solicitudes entre múltiples modelos de IA. La empresa afirma que estos lanzamientos están diseñados para sistemas agénticos siempre activos que necesitan equilibrar precisión, tiempo de respuesta, costo operativo y control del despliegue.

El lanzamiento refleja un cambio en la forma en que NVIDIA posiciona los modelos abiertos. En lugar de presentar Lightning como un reemplazo independiente de cualquier modelo de frontera, la empresa lo describe como un especialista que puede encargarse de tareas de gran volumen dentro de sistemas más grandes. Switchyard está pensado para decidir qué modelo debe gestionar cada paso de un flujo de trabajo de agente, reduciendo potencialmente la cantidad de solicitudes enviadas a modelos más caros.

Un modelo especialista para sistemas multiagente

Nemotron 3.5 Lightning se posiciona para cargas de trabajo específicas como revisión de código, uso de herramientas, supervisión de alertas de seguridad y soporte de facturación. NVIDIA dice que los modelos de razonamiento más grandes pueden planificar o coordinar una operación mientras los modelos especializados más pequeños ejecutan tareas individuales. Esa arquitectura es cada vez más relevante para los desarrolladores que construyen agentes que funcionan de forma continua en lugar de responder a consultas de chat ocasionales.

Según NVIDIA, el modelo es abierto y personalizable. Las organizaciones pueden hacer post-entrenamiento con NVIDIA NeMo utilizando sus propios datos de dominio, herramientas y flujos de trabajo. NVIDIA también publicó Nemotron-RL-Agentic-Terminal-Pivot, un conjunto de datos de aprendizaje por refuerzo utilizado en el post-entrenamiento del modelo para capacidades de agentes de programación.

La empresa afirma que Lightning puede ofrecer hasta cuatro veces más rapidez en la generación de salida y completar tareas agénticas un 30% más rápido que otros modelos de su clase. Esas cifras son afirmaciones de rendimiento reportadas por NVIDIA, no resultados verificados de forma independiente en las pruebas proporcionadas. El conjunto de comparación y las condiciones de prueba no se detallan en el anuncio disponible, por lo que los compradores deberán validar los beneficios con sus propios prompts, herramientas y hardware.

NVIDIA dice que el modelo puede ejecutarse en PCs NVIDIA RTX, DGX Spark, DGX Station, sistemas Jetson, estaciones de trabajo RTX PRO, centros de datos y entornos en la nube. Ese rango importa para equipos que manejan datos sensibles o buscan usar infraestructura existente en lugar de enviar cada solicitud a una API alojada.

Switchyard convierte la elección del modelo en infraestructura

NeMo Switchyard aborda un problema práctico en el desarrollo de agentes: distintas tareas suelen requerir distintos modelos, pero gestionar manualmente esas decisiones puede convertirse en una gran carga de integración. La biblioteca de NVIDIA puede enrutar solicitudes a través de la mezcla de modelos abiertos, propietarios y de NVIDIA de una organización sin que los desarrolladores tengan que reescribir sus aplicaciones.

El enrutador puede ajustarse para priorizar calidad, latencia y costo. En un sistema que usa un modelo de frontera para la planificación pero un modelo más pequeño para la ejecución rutinaria, este enfoque podría hacer que la selección del modelo forme parte del tiempo de ejecución de la aplicación, en lugar de ser una decisión arquitectónica fija.

La forma en que NVIDIA lo presenta también apunta a un cambio más amplio en la infraestructura de IA. Como los agentes realizan múltiples llamadas durante un solo flujo de trabajo, el uso de tokens y la latencia pueden acumularse rápidamente. Una capa de enrutamiento que envíe solo las solicitudes difíciles a modelos premium puede ser más valiosa que una modesta mejora en la puntuación de referencia de un solo modelo, especialmente para atención al cliente, programación, seguridad y automatización de back office.

Switchyard se pondrá a disposición como biblioteca de código abierto. NVIDIA dice que está trabajando con empresas del ecosistema para integrar el enrutamiento en herramientas y plataformas de desarrollo existentes, incluyendo Kong AI Gateway, LiteLLM y Hermes de Nous Research. LangChain también se cita como socio de integración, mientras que Cognition ha probado un enrutador por etapas en Devin Desktop para uso interno de NVIDIA.

Qué muestran — y qué no muestran — las pruebas de rendimiento

NVIDIA informa que los benchmarks internos mantuvieron una precisión de nivel de frontera mientras reducían el costo de completar tareas a casi un tercio del uso de Opus 4.8 por sí solo. Como el benchmark es interno y controlado por el proveedor, la afirmación debe tomarse como orientativa y no como una garantía general. Los resultados dependerán del conjunto de modelos, la política de enrutamiento, la mezcla de cargas de trabajo y cuánto deterioro de calidad acepte una organización.

Los ejemplos de socios ofrecen señales adicionales, aunque también suministradas por el proveedor. NVIDIA dice que Boomi logró un 100% de precisión de enrutamiento de dominio en cinco capacidades de enrutamiento, envió el 59% del tráfico a un modelo ajustado finamente que era cinco veces más rápido y redujo la latencia en turnos posteriores en un 21%. Classmethod informó una reducción inicial de costes del 27% manteniendo la calidad, mientras que Cognition reportó una reducción del 28% en el coste medio en comparación con enviar todas las solicitudes a un solo modelo de frontera.

Otros resultados citados varían. NVIDIA dice que Cadence mejoró la eficiencia en un 9,9% en un caso de uso de verificación formal. LangChain informó un coste 74% menor en 145 tareas de Deep Agents de múltiples turnos al enviar el 7% de las llamadas a un modelo de frontera, con un intercambio del 6% en precisión. Estas cifras ilustran el intercambio central del enrutamiento: el ahorro puede ser sustancial, pero el menor costo puede venir acompañado de cambios en la precisión, la latencia o el comportamiento del flujo de trabajo.

NVIDIA también menciona a CrowdStrike, Harvey con Trajectory, CodeRabbit con Baseten, Lila Sciences y Fastino Labs como organizaciones que personalizan Nemotron 3.5 Lightning. El anuncio no proporciona evaluaciones independientes de clientes, escala de producción, detalles de contratos ni métricas de adopción. Por lo tanto, las afirmaciones más sólidas sobre velocidad, costo y rendimiento de clientes siguen atribuyéndose a NVIDIA y a sus socios citados.

Por qué esto importa para los constructores de IA y las empresas

Para los desarrolladores, la combinación de un modelo personalizable y una capa de enrutamiento podría reducir la dependencia de un único proveedor. Los equipos pueden asignar tareas sensibles o repetitivas a un modelo desplegado localmente, manteniendo el acceso a sistemas propietarios para los casos más difíciles. Eso puede respaldar requisitos de privacidad, reducir los costos recurrentes de inferencia y dar a los equipos de ingeniería más control sobre las actualizaciones de modelos.

La contrapartida es la complejidad operativa. Un enrutador debe evaluarse no solo por la precisión media, sino también por el manejo de fallos, la fiabilidad de las llamadas a herramientas, la retención de contexto y el comportamiento en tareas de varios turnos. Una caída aparentemente pequeña en la precisión puede volverse material cuando un agente toma decenas de decisiones en un flujo de trabajo. Las organizaciones también necesitarán observabilidad que explique por qué una solicitud fue enrutada a un modelo concreto y si esa decisión mejoró el resultado.

Para los compradores empresariales, el valor de Switchyard dependerá de la interoperabilidad y la gobernanza. Enrutar entre modelos de distintos proveedores puede reducir el bloqueo, pero también introduce más componentes que proteger, supervisar y auditar. El énfasis de NVIDIA en publicar datos y técnicas de entrenamiento donde la licencia lo permita puede ayudar a investigadores y equipos de gobernanza a examinar el modelo, aunque la divulgación por sí sola no demuestra fiabilidad en producción.

El lanzamiento también agudiza la competencia en torno a la pila de aplicaciones de IA. Los proveedores de modelos compiten cada vez más no solo en capacidad bruta, sino en el plano de control alrededor de la inferencia: enrutamiento, ajuste fino, ubicación del despliegue y gestión de costes. NVIDIA está utilizando su ecosistema de hardware y su software NeMo para conectar esas capas desde PCs locales hasta infraestructura en la nube.

Qué vigilar a continuación

La primera señal será la prueba independiente de Nemotron 3.5 Lightning en cargas de trabajo de programación, seguridad y uso de herramientas empresariales, incluidas comparaciones con modelos abiertos de tamaño similar. Las evaluaciones publicadas deberían aclarar si las afirmaciones de velocidad de NVIDIA se mantienen en distinto hardware y en tareas de agente de contexto largo.

Los desarrolladores también deberían observar con qué amplitud aparece NeMo Switchyard en marcos de producción, especialmente si integraciones como LiteLLM y Kong reducen los costes de configuración para aplicaciones existentes. La evidencia sobre fallos de enrutamiento, compensaciones de precisión y capacidades de monitorización será más útil que el simple ahorro destacado en titulares.

Por último, la adopción empresarial dependerá de la economía del despliegue. Las preguntas importantes son si la ejecución local y on-premises puede igualar a las alternativas alojadas, cuánto post-entrenamiento se necesita para lograr precisión de dominio y si el enrutamiento de modelos produce ahorros fiables una vez incluidos los costes de infraestructura, evaluación y gobernanza.

Perspectiva de Creati.ai

El anuncio de NVIDIA es más significativo como apuesta de infraestructura: las aplicaciones agénticas podrían construirse a partir de especialistas de modelo coordinados en lugar de un modelo universal. Nemotron 3.5 Lightning aporta un especialista personalizable, mientras que NeMo Switchyard aborda la decisión en tiempo de ejecución de cuándo usarlo.

La oportunidad es creíble, pero la evidencia sigue procediendo en gran medida de NVIDIA. Para los desarrolladores, la prueba práctica no es si el enrutamiento reduce el costo de un benchmark aislado; es si preserva la fiabilidad de la tarea de extremo a extremo al tiempo que facilita gestionar el despliegue, la privacidad y las operaciones del modelo.

Destacados

NVIDIA apunta a agentes de IA siempre activos con Nemotron 3.5 Lightning y NeMo Switchyard

NVIDIA lanzó un modelo abierto eficiente y una biblioteca de enrutamiento orientados a reducir el costo, la latencia y la fricción de despliegue de los agentes de IA empresariales.