AI News

NVIDIA está posicionando NeMo Switchyard como una capa de orquestación para agentes de IA que necesitan usar más de un modelo. En un blog técnico, la empresa describió un SDK y un marco de enrutamiento que pueden dirigir solicitudes individuales, pasos del agente o fases de una tarea a modelos seleccionados según capacidad, costo, latencia y condiciones de infraestructura.

El anuncio aborda un problema de ingeniería creciente: usar un modelo de frontera para cada acción del agente puede elevar los costos de inferencia y la latencia, mientras que depender de un modelo más pequeño en todas partes puede reducir la calidad de la tarea. El enfoque de NVIDIA consiste en tratar la selección del modelo como una decisión en tiempo de ejecución en lugar de un ajuste fijo de la aplicación.

Una capa de enrutamiento entre agentes y proveedores de modelos

NeMo Switchyard separa la lógica de enrutamiento de los puntos finales del modelo que finalmente procesan las solicitudes. Su SDK agnóstico al proveedor, identificado en la publicación como switchyard-libsy, representa las solicitudes, define los objetivos de modelo disponibles y gestiona las llamadas al proveedor seleccionado.

Cada objetivo tiene un nombre semántico, mientras que la configuración del cliente asigna ese nombre a un punto final de proveedor y a un identificador de modelo. Ese diseño permite a los desarrolladores cambiar implementaciones o proveedores de modelos sin reescribir la lógica de enrutamiento en toda una aplicación de agente. NVIDIA también dice que los desarrolladores pueden aportar sus propios algoritmos de enrutamiento y datos de personalización.

En tiempo de ejecución, un enrutador puede evaluar la solicitud y su contexto antes de elegir un modelo. El enrutamiento puede ocurrir una vez para una solicitud completa, en cada paso de una interacción de varios turnos, o a lo largo de diferentes fases de una misma tarea. El diseño apropiado depende de factores como la tolerancia al error, la latencia, el rendimiento y la complejidad de la implementación.

Esto es especialmente relevante para los agentes de IA que combinan clasificación, razonamiento, uso de herramientas y trabajo rutinario de seguimiento. Esos pasos no necesariamente requieren las mismas capacidades del modelo, y sus perfiles de costo pueden diferir sustancialmente.

Qué evalúa el enrutador

NVIDIA agrupa las señales disponibles para un sistema de enrutamiento en tres grandes categorías: capacidades del modelo, perfiles de costo del modelo y condiciones de infraestructura. Las señales de capacidad pueden incluir clasificación de solicitudes, dificultad estimada, embeddings o características extraídas del prompt. El enrutador también puede usar señales a nivel de modelo, como probabilidades logarítmicas, trazas del agente u otra información interna y relacionada con la salida, según la implementación.

Las señales del sistema incluyen precios, latencia, carga y condiciones de error. Estas importan porque el modelo teóricamente más fuerte puede no ser la mejor opción operativa si no está disponible, es lento, caro o experimenta tasas elevadas de fallos. En un flujo de trabajo de agente, la infraestructura también debe soportar una transferencia invisible para el usuario y que no rompa el contexto de la aplicación.

Por lo tanto, el marco va más allá de una simple cascada de “modelo pequeño frente a modelo grande”. Un enrutador podría usar distintos grupos de modelos para subagentes, enrutar por tema o cambiar de modelos entre etapas de una misma tarea. NVIDIA presenta esta flexibilidad como una forma de hacer que la selección de modelo responda tanto al trabajo como al estado del sistema de servicio.

Evidencia y límites de las afirmaciones

La evidencia de rendimiento más sólida en el material es reportada por el proveedor. NVIDIA ilustra el enfoque con un sistema de modelos evaluado en Terminal-Bench Hard, un benchmark para tareas de uso de computadora. En el ejemplo de la empresa, DeepSeek V4 tiene la mayor precisión general, pero otros modelos rinden mejor en grupos de tareas concretos: Kimi K2.6 para categorías de aprendizaje automático y aprendizaje por refuerzo, y Qwen3.5 397B A17B para categorías de matemáticas y ciencias.

NVIDIA sostiene que asignar cada grupo de tareas a su modelo más fuerte puede superar una estrategia de un solo modelo en las dimensiones que importan para una implementación. La publicación también señala que el costo y el tiempo de finalización complican la elección porque los modelos difieren en costo de acceso u operación, latencia, uso de tokens y comportamiento de llamadas a herramientas.

La fuente menciona pruebas y evaluaciones con LangChain y Cognition como ejemplos de cómo el enrutamiento reduce costos manteniendo una alta precisión. Sin embargo, el material proporcionado no ofrece condiciones de prueba detalladas, configuraciones base, reducciones porcentuales ni validación independiente. Por tanto, esos resultados deben tratarse como evidencia reportada por NVIDIA y no como una garantía general para cada carga de trabajo de agente.

Esa salvedad es importante. El enrutador en sí introduce requisitos de ingeniería y evaluación. Clasificaciones incorrectas, datos de costos desactualizados, estimaciones de tareas débiles o una transferencia poco fiable pueden borrar la ventaja de usar un modelo mejor adaptado a la solicitud. Los equipos deberán medir la sobrecarga de enrutamiento y los modos de fallo junto con la calidad del modelo.

Por qué importa para desarrolladores y equipos empresariales

Para los desarrolladores, NeMo Switchyard podría reducir la necesidad de codificar rígidamente un solo modelo en el flujo de control de un agente. Un equipo que construya un asistente de investigación, un sistema de programación o un agente de uso de computadora podría reservar un modelo más capaz para el razonamiento difícil mientras envía acciones más simples de clasificación o seguimiento a objetivos más baratos.

La abstracción del proveedor también puede ayudar a los equipos a gestionar una cartera de modelos que cambia rápidamente. La calidad, el precio, la disponibilidad y la latencia de los modelos pueden cambiar de forma independiente, lo que dificulta mantener decisiones de modelo estáticas. Separar los nombres semánticos de los modelos de los identificadores específicos del proveedor ofrece a los operadores un lugar para actualizar esos mapeos sin cambiar la política de enrutamiento de nivel superior.

Los compradores empresariales deberían centrarse menos en la promesa de reducción automática de costos y más en la gobernanza. Un enrutador de producción necesita políticas claras para solicitudes sensibles, trazabilidad de las elecciones de modelo, comportamiento de respaldo y controles sobre qué proveedores pueden recibir determinados datos. También necesita evaluación específica de la carga de trabajo: la precisión en el resultado final del agente, no solo el rendimiento en una llamada aislada al modelo.

La implicación competitiva es más amplia que el SDK de NVIDIA. El enrutamiento de modelos se está convirtiendo en un punto de control entre las aplicaciones y un mercado de modelos cada vez más fragmentado. Los proveedores que ofrezcan enrutamiento fiable, observabilidad, aplicación de políticas y portabilidad de implementación pueden influir en cómo los clientes consumen modelos incluso cuando no suministran todos los modelos del grupo.

Qué observar a continuación

Las próximas señales serán prácticas más que promocionales. Los desarrolladores deberían buscar documentación pública y ejemplos que muestren cómo NeMo Switchyard se integra con stacks de servicio, marcos de agentes y sistemas de observabilidad de producción. Resultados más detallados de las pruebas con LangChain y Cognition ayudarían a establecer cuánto mejora el costo o la latencia que ofrece el enrutamiento bajo cargas de trabajo específicas.

También será importante ver si el SDK admite controles de políticas robustos, ciclos de evaluación, respaldos de modelos y señales de infraestructura en tiempo real. Esas funciones determinarán si el enrutamiento sigue siendo una técnica de benchmark o se convierte en infraestructura de producción fiable.

Por último, la adopción dependerá de cuán fácilmente los equipos puedan incorporar modelos de distintos proveedores en un grupo común. El diseño agnóstico al proveedor es un objetivo declarado, pero la portabilidad práctica se pondrá a prueba con autenticación, manejo de datos, compatibilidad con herramientas, límites de contexto y diferencias en el comportamiento del modelo.

Perspectiva de Creati.ai

NeMo Switchyard de NVIDIA es notable porque enmarca la optimización de agentes como un problema de sistemas y no como una competencia de selección de modelos. La oportunidad central es emparejar cada unidad de trabajo con un modelo apropiado mientras se tienen en cuenta las realidades operativas de su servicio.

El concepto es creíble, pero el valor lo decidirán la calidad del enrutamiento y los controles de producción. Hasta que NVIDIA publique resultados más granulares y verificables de forma independiente, los desarrolladores deberían tratar el marco como una arquitectura que debe evaluarse frente a sus propias cargas de trabajo, no como evidencia de que el enrutamiento multimodelo reduce automáticamente los costos sin compensaciones.

Destacados

NVIDIA presenta NeMo Switchyard para enrutar tareas de agentes de IA entre modelos

NeMo Switchyard de NVIDIA enruta tareas de agentes de IA entre modelos para equilibrar precisión, latencia, límites de infraestructura y costo de inferencia en flujos de trabajo de producción.