
NVIDIA представила Nemotron 3.5 Lightning — модель mixture-of-experts с 30 миллиардами параметров — вместе с NeMo Switchyard, библиотекой с открытым исходным кодом для маршрутизации запросов между несколькими ИИ-моделями. Компания заявляет, что релизы предназначены для постоянно работающих агентных систем, которым необходимо балансировать точность, время отклика, операционные расходы и контроль над развертыванием.
Запуск отражает изменение в том, как NVIDIA позиционирует открытые модели. Вместо того чтобы представлять Lightning как самостоятельную замену любой frontier-модели, компания описывает его как специалиста, способного обрабатывать задачи с большим объёмом внутри более крупных систем. Switchyard предназначен для определения того, какая модель должна обрабатывать каждый шаг рабочего процесса агента, потенциально сокращая количество запросов, отправляемых более дорогим моделям.
Nemotron 3.5 Lightning позиционируется для целевых рабочих нагрузок, таких как проверка кода, использование инструментов, мониторинг предупреждений безопасности и поддержка биллинга. NVIDIA утверждает, что более крупные модели рассуждения могут планировать или координировать операцию, а меньшие специализированные модели — выполнять отдельные задачи. Эта архитектура становится всё более актуальной для разработчиков, создающих агентов, которые работают непрерывно, а не только реагируют на случайные чат-запросы.
По словам NVIDIA, модель открыта и настраиваема. Организации могут проводить пост-обучение с NVIDIA NeMo, используя собственные доменные данные, инструменты и рабочие процессы. NVIDIA также выпустила Nemotron-RL-Agentic-Terminal-Pivot — набор данных для обучения с подкреплением, использованный при пост-обучении модели для возможностей кодирующего агента.
Компания заявляет, что Lightning может выдавать результат до четырёх раз быстрее и выполнять агентные задачи на 30% быстрее, чем другие модели своего класса. Эти цифры являются заявлениями о производительности, опубликованными NVIDIA, а не независимыми результатами, подтверждёнными на предоставленных данных. В доступном объявлении не указаны состав сравнения и условия тестирования, поэтому покупателям придётся проверять преимущества на своих собственных запросах, инструментах и оборудовании.
NVIDIA сообщает, что модель может работать на ПК NVIDIA RTX, DGX Spark, DGX Station, системах Jetson, рабочих станциях RTX PRO, в дата-центрах и облачных средах. Этот диапазон важен для команд, работающих с конфиденциальными данными или стремящихся использовать существующую инфраструктуру вместо отправки каждого запроса в хостируемый API.
NeMo Switchyard решает практическую проблему разработки агентов: для разных задач часто требуются разные модели, но ручное управление этими решениями может стать большим бременем интеграции. Библиотека NVIDIA может маршрутизировать запросы через смесь открытых, проприетарных и NVIDIA-моделей в организации без необходимости переписывать приложения.
Маршрутизатор можно настраивать под приоритеты, включая качество, задержку и стоимость. В системе, где для планирования используется frontier-модель, а для рутинного выполнения — более маленькая модель, этот подход может сделать выбор модели частью времени выполнения приложения, а не фиксированным архитектурным решением.
Позиционирование NVIDIA также указывает на более широкое изменение ИИ-инфраструктуры. Поскольку агенты совершают несколько вызовов в рамках одного рабочего процесса, расход токенов и задержка могут быстро накапливаться. Слой маршрутизации, который отправляет только сложные запросы к премиальным моделям, может оказаться более ценным, чем небольшое улучшение бенчмарка одной модели, особенно в клиентской поддержке, программировании, безопасности и автоматизации бэк-офиса.
Switchyard будет доступен как библиотека с открытым исходным кодом. NVIDIA говорит, что работает с компаниями экосистемы над интеграцией маршрутизации в существующие инструменты и платформы для разработчиков, включая Kong AI Gateway, LiteLLM и Hermes от Nous Research. LangChain также указан как партнёр по интеграции, а Cognition протестировала многоступенчатый маршрутизатор в Devin Desktop для внутреннего использования NVIDIA.
NVIDIA сообщает, что внутренние бенчмарки сохранили точность уровня frontier, при этом снизив стоимость выполнения задач почти до одной трети от использования Opus 4.8 в одиночку. Поскольку бенчмарк внутренний и контролируется поставщиком, это заявление следует рассматривать как ориентир, а не как общую гарантию. Результаты будут зависеть от пула моделей, политики маршрутизации, смеси рабочих нагрузок и того, какой уровень ухудшения качества готова принять организация.
Примеры партнёров дают дополнительные, хотя всё ещё предоставленные поставщиком, сигналы. NVIDIA утверждает, что Boomi достигла 100% точности маршрутизации по доменам в пяти возможностях маршрутизации, направила 59% трафика на тонко настроенную модель, которая была в пять раз быстрее, и снизила задержку на последующих ходах на 21%. Classmethod сообщила о первоначальном снижении затрат на 27% при сохранении качества, а Cognition — о снижении средних затрат на 28% по сравнению с отправкой всех запросов в одну frontier-модель.
Другие приведённые результаты различаются. NVIDIA сообщает, что Cadence повысила эффективность на 9,9% в сценарии формальной верификации. LangChain сообщил о снижении затрат на 74% в 145 многоходовых задачах Deep Agents при отправке 7% вызовов frontier-модели, ценой 6%-ного компромисса в точности. Эти цифры иллюстрируют ключевой компромисс маршрутизации: экономия может быть значительной, но более низкая стоимость может сопровождаться изменениями точности, задержки или поведения рабочего процесса.
NVIDIA также называет CrowdStrike, Harvey with Trajectory, CodeRabbit with Baseten, Lila Sciences и Fastino Labs в числе организаций, настраивающих Nemotron 3.5 Lightning. В объявлении не приводятся независимые оценки клиентов, масштабы внедрения, детали контрактов или метрики использования. Поэтому самые сильные заявления о скорости, стоимости и результатах клиентов остаются относимыми к NVIDIA и её указанным партнёрам.
Для разработчиков сочетание настраиваемой модели и слоя маршрутизации может снизить зависимость от одного поставщика. Команды могут назначать чувствительные или повторяющиеся задачи локально развёрнутой модели, сохраняя доступ к проприетарным системам для более сложных случаев. Это может поддержать требования к конфиденциальности, снизить повторяющиеся расходы на инференс и дать инженерным командам больше контроля над обновлениями моделей.
Обратная сторона — операционная сложность. Маршрутизатор нужно оценивать не только по средней точности, но и по обработке сбоев, надёжности вызовов инструментов, сохранению контекста и поведению в многоходовых задачах. Даже небольшое снижение точности может стать существенным, когда агент принимает десятки решений в рабочем процессе. Организациям также потребуется наблюдаемость, объясняющая, почему запрос был направлен к конкретной модели и улучшило ли это решение результат.
Для корпоративных покупателей ценность Switchyard будет зависеть от совместимости и управления. Маршрутизация между моделями разных поставщиков может снизить зависимость от одного вендора, но также добавляет больше компонентов для защиты, мониторинга и аудита. Акцент NVIDIA на публикации обучающих данных и методик там, где это разрешено лицензией, может помочь исследователям и командам по управлению изучить модель, хотя сама по себе публикация не доказывает надёжность в production.
Этот релиз также обостряет конкуренцию вокруг стека ИИ-приложений. Поставщики моделей всё чаще конкурируют не только по сырой мощности, но и по управляющему слою вокруг инференса: маршрутизации, дообучению, месту развёртывания и управлению затратами. NVIDIA использует свою аппаратную экосистему и ПО NeMo, чтобы связать эти уровни от локальных ПК до облачной инфраструктуры.
Первым сигналом станут независимые тесты Nemotron 3.5 Lightning на рабочих нагрузках, связанных с программированием, безопасностью и корпоративным использованием инструментов, включая сравнения с открытыми моделями сопоставимого размера. Публикуемые оценки должны показать, сохраняются ли заявления NVIDIA о скорости на разном оборудовании и в агентных задачах с длинным контекстом.
Разработчикам также стоит следить за тем, насколько широко NeMo Switchyard появится в production-фреймворках, особенно уменьшат ли такие интеграции, как LiteLLM и Kong, стоимость настройки для существующих приложений. Данные о сбоях маршрутизации, компромиссах в точности и возможностях мониторинга будут полезнее, чем только заявленная экономия.
Наконец, внедрение в предприятиях будет зависеть от экономики развёртывания. Важные вопросы: может ли локальное и on-premises-исполнение конкурировать с хостируемыми альтернативами, сколько пост-обучения требуется для точности в домене и даёт ли маршрутизация моделей надёжную экономию после учёта затрат на инфраструктуру, оценку и управление.
Объявление NVIDIA наиболее значимо как ставка на инфраструктуру: агентные приложения могут строиться из скоординированных специалистов-моделей, а не из одной универсальной модели. Nemotron 3.5 Lightning предоставляет настраиваемого специалиста, а NeMo Switchyard решает задачу runtime-выбора, когда его использовать.
Возможность выглядит убедительно, но доказательства в основном исходят от самой NVIDIA. Для разработчиков практическая проверка — не в том, снижает ли маршрутизация стоимость отдельного бенчмарка; важно, сохраняет ли она надёжность выполнения задачи end-to-end, одновременно облегчая управление развёртыванием, конфиденциальностью и эксплуатацией моделей.
NVIDIA представила эффективную открытую модель и библиотеку маршрутизации, призванные снизить стоимость, задержки и сложность внедрения корпоративных ИИ-агентов.