AI News

NVIDIA позиционирует NeMo Switchyard как уровень оркестрации для ИИ-агентов, которым нужно использовать более одной модели. В техническом блоге компания описала SDK и фреймворк маршрутизации, которые могут направлять отдельные запросы, шаги агента или фазы задачи к моделям, выбранным в зависимости от возможностей, стоимости, задержки и состояния инфраструктуры.

Анонс решает растущую инженерную проблему: использование передовой модели для каждого действия агента может повышать стоимость инференса и задержку, тогда как повсеместная опора на более маленькую модель может снижать качество выполнения задачи. Подход NVIDIA состоит в том, чтобы рассматривать выбор модели как решение во время выполнения, а не как фиксированную настройку приложения.

Слой маршрутизации между агентами и поставщиками моделей

NeMo Switchyard отделяет логику маршрутизации от конечных точек моделей, которые в итоге обрабатывают запросы. Его независимый от поставщика SDK, обозначенный в публикации как switchyard-libsy, представляет запросы, определяет доступные целевые модели и управляет вызовами к выбранному поставщику.

Каждая цель имеет семантическое имя, а конфигурация клиента сопоставляет это имя с конечной точкой поставщика и идентификатором модели. Такая конструкция позволяет разработчикам менять развертывания или поставщиков моделей, не переписывая логику маршрутизации по всему приложению агента. NVIDIA также заявляет, что разработчики могут предоставлять собственные алгоритмы маршрутизации и данные для настройки.

Во время выполнения маршрутизатор может оценивать запрос и его контекст перед выбором модели. Маршрутизация может происходить один раз для полного запроса, на каждом шаге многоходового взаимодействия или на разных фазах одной задачи. Подходящая схема зависит от таких факторов, как допустимость ошибок, задержка, пропускная способность и сложность развертывания.

Это особенно важно для ИИ-агентов, которые объединяют классификацию, рассуждение, использование инструментов и рутинную последующую работу. Эти шаги не обязательно требуют одних и тех же возможностей модели, а их профили затрат могут существенно различаться.

Что оценивает маршрутизатор

NVIDIA делит сигналы, доступные системе маршрутизации, на три широкие категории: возможности модели, профили затрат модели и условия инфраструктуры. Сигналы возможностей могут включать классификацию запроса, оцененную сложность, embeddings или признаки, извлеченные из промпта. В зависимости от реализации маршрутизатор также может использовать сигналы уровня модели, такие как логарифмические вероятности, трассы агента или другую внутреннюю и выходную информацию.

Системные сигналы включают цены, задержку, нагрузку и ошибки. Это важно, потому что теоретически самая сильная модель может оказаться не лучшим операционным выбором, если она недоступна, медленна, дорога или испытывает повышенный уровень сбоев. В рабочем процессе агента инфраструктура также должна поддерживать передачу, незаметную для пользователя и не разрушающую контекст приложения.

Таким образом, фреймворк выходит за рамки простой схемы «малая модель против большой модели». Маршрутизатор может использовать разные пулы моделей для субагентов, маршрутизировать по теме или переключать модели между этапами одной и той же задачи. NVIDIA представляет эту гибкость как способ сделать выбор модели чувствительным и к работе, и к состоянию системы обслуживания.

Доказательства и ограничения заявлений

Самое убедительное подтверждение производительности в материале — это отчетность самого вендора. NVIDIA иллюстрирует подход системой моделей, оцененных на Terminal-Bench Hard — бенчмарке для задач компьютерного использования. В примере компании DeepSeek V4 показывает наивысшую общую точность, но другие модели лучше справляются с отдельными группами задач: Kimi K2.6 для категорий машинного обучения и обучения с подкреплением, а Qwen3.5 397B A17B — для категорий математики и наук.

NVIDIA утверждает, что назначение каждой группы задач на ее сильнейшую модель может превосходить стратегию одной модели по тем параметрам, которые важны для развертывания. В публикации также отмечается, что стоимость и время завершения усложняют выбор, поскольку модели различаются по стоимости доступа или эксплуатации, задержке, использованию токенов и поведению при вызовах инструментов.

Источник ссылается на бенчмаркинг и тестирование с использованием LangChain и Cognition как на примеры того, как маршрутизация снижает затраты при сохранении высокой точности. Однако в предоставленном материале нет подробных условий тестирования, базовых конфигураций, процентных сокращений или независимой проверки. Поэтому эти результаты следует рассматривать как приведенные NVIDIA доказательства, а не как общее обещание для любой рабочей нагрузки агента.

Это важное уточнение. Сам маршрутизатор добавляет инженерные и оценочные требования. Неверная классификация, устаревшие данные о стоимости, слабые оценки задач или ненадежная передача могут свести на нет преимущество использования модели, лучше соответствующей запросу. Командам нужно измерять накладные расходы маршрутизации и режимы отказов наряду с качеством модели.

Почему это важно для разработчиков и корпоративных команд

Для разработчиков NeMo Switchyard может снизить необходимость жестко встраивать одну модель в логику управления агентом. Команда, создающая исследовательского помощника, систему для кодирования или агента компьютерного использования, может зарезервировать более мощную модель для сложного рассуждения, а более простые действия классификации или последующих шагов направлять на менее дорогие цели.

Абстракция поставщика также может помочь командам управлять быстро меняющимся портфелем моделей. Качество, цена, доступность и задержка моделей могут меняться независимо, что усложняет поддержку статического выбора моделей. Разделение семантических имен моделей и идентификаторов, зависящих от поставщика, дает операторам место, где можно обновлять эти сопоставления, не меняя общую политику маршрутизации.

Корпоративным покупателям следует уделять меньше внимания обещанию автоматического снижения затрат и больше — управлению. Производственный маршрутизатор нуждается в четких политиках для чувствительных запросов, в аудируемости выбора модели, в поведении отказоустойчивости и в контроле над тем, какие поставщики могут получать определенные данные. Ему также нужна оценка, специфичная для рабочей нагрузки: точность на конечном результате агента, а не только производительность изолированного вызова модели.

Конкурентное значение выходит за рамки SDK NVIDIA. Маршрутизация моделей становится точкой контроля между приложениями и все более фрагментированным рынком моделей. Поставщики, предлагающие надежную маршрутизацию, наблюдаемость, enforcement политик и переносимость развертывания, могут влиять на то, как клиенты потребляют модели, даже если они не поставляют все модели в пуле.

На что смотреть дальше

Следующие сигналы будут практическими, а не рекламными. Разработчикам стоит искать публичную документацию и примеры, показывающие, как NeMo Switchyard интегрируется со стеком обслуживания, фреймворками агентов и системами наблюдаемости в продакшене. Более подробные результаты тестирования с LangChain и Cognition помогли бы понять, насколько маршрутизация снижает стоимость или задержку в конкретных рабочих нагрузках.

Также важно будет увидеть, поддерживает ли SDK надежные политики контроля, циклы оценки, фолбэки моделей и сигналы инфраструктуры в реальном времени. Эти функции определят, останется ли маршрутизация техникой для бенчмарков или станет надежной производственной инфраструктурой.

Наконец, внедрение будет зависеть от того, насколько легко командам удастся объединить модели разных поставщиков в общий пул. Независимость от поставщика заявлена как цель, но практическая переносимость будет проверяться аутентификацией, обработкой данных, совместимостью с инструментами, ограничениями контекста и различиями в поведении моделей.

Мнение Creati.ai

NeMo Switchyard NVIDIA примечателен тем, что рассматривает оптимизацию агентов как системную проблему, а не как конкурс выбора модели. Главная возможность состоит в том, чтобы сопоставлять каждую единицу работы с подходящей моделью, учитывая при этом операционные реалии ее обслуживания.

Концепция убедительна, но ценность будет определяться качеством маршрутизации и производственными контролями. Пока NVIDIA не опубликует более детальные и независимо проверяемые результаты, разработчикам следует рассматривать фреймворк как архитектуру, которую нужно оценивать на своих собственных рабочих нагрузках, а не как доказательство того, что многомодельная маршрутизация автоматически снижает затраты без компромиссов.

Рекомендуемые

NVIDIA представила NeMo Switchyard для маршрутизации задач ИИ-агентов между моделями

NeMo Switchyard от NVIDIA маршрутизирует задачи ИИ-агентов между моделями, чтобы сбалансировать точность, задержку, ограничения инфраструктуры и стоимость инференса в производственных рабочих процессах.