
Nvidia выпустила Nemotron 3.5 Lightning — open-weight модель рассуждений, предназначенную для того, чтобы сделать рабочие нагрузки ИИ-агентов быстрее и дешевле в эксплуатации, а не для максимизации результата по каждому бенчмарку на интеллект.
Модель сочетает 31,6 млрд общих параметров с разреженной архитектурой, которая активирует только 3,6 млрд параметров на каждый токен. По данным бенчмаркинга, о котором сообщил The Decoder, в предрелизном тестировании с финальными весами NVFP4 от Nvidia она достигает почти 670 токенов в секунду, делая пропускную способность центральной особенностью нового релиза Nemotron 3.5.
Такое позиционирование важно по мере того, как разработчики переходят от разовых запросов чат-бота к агентным системам, которые генерируют длинные последовательности вызовов инструментов, кода и промежуточных рассуждений. Для таких нагрузок задержка, использование оборудования и стоимость обслуживания могут быть не менее важны, чем максимальный балл модели в бенчмарках.
Nemotron 3.5 Lightning приходит на смену Nemotron 3 Nano 30B A3B и сохраняет гибридную архитектуру Mamba-Transformer предыдущей модели. Общее число параметров существенно больше числа, используемого в любом отдельном вычислении, — такая структура призвана дать больше мощности без полного вычислительного расхода плотной модели с 31,6 млрд параметров.
Nvidia предлагает модель рассуждений в форматах BF16 и NVFP4. Последний использует веса с более низкой точностью, чтобы сократить память и вычисления, необходимые для инференса. The Decoder сообщил, что NVFP4 показал тот же результат, что и версия BF16, в Artificial Analysis Intelligence Index, при этом разница в качестве по этой оценке была небольшой.
Модель текстовая и поддерживает окно контекста до одного миллиона токенов. Такой объём может быть полезен для кодовых агентов, документно-ориентированных рабочих процессов и приложений, которым нужно сохранять большой объём истории задач, хотя сам по себе размер контекста не показывает, насколько эффективно и надёжно система будет обрабатывать очень длинные входы.
Весы доступны по разрешительной лицензии OpenMDW-1.1 от Nvidia. The Decoder также перечислил серверный доступ через таких провайдеров, как DeepInfra, Fireworks, FriendliAI, CoreWeave, GMI Cloud, Nebius и Crusoe. Доступность на нескольких платформах инференса снижает барьер для команд, которые хотят протестировать модель, не разворачивая сразу собственную инфраструктуру Nvidia.
По сообщению The Decoder, Artificial Analysis присвоила Nemotron 3.5 Lightning 24 балла в Intelligence Index. Это совпало с показателем OpenAI gpt-oss-120b и уступило Nvidia Nemotron 3 Super, который набрал 26. Результат означал улучшение на девять пунктов по сравнению с сообщённой оценкой Nemotron 3 Nano в 15.
Сравнение также показывает пределы подхода Nvidia. The Decoder сообщил о более высоких результатах у Qwen3.6 35B A3B и Muse Glimmer от Meta — 32 и 35 соответственно. В цитируемом анализе закрытые системы по-прежнему опережали по совокупному компромиссу скорости и интеллекта: Google Gemini 3.5 Flash-Lite, по сообщениям, набрал 37, а GPT-5.6 Luna достиг 52.
Наиболее сильные результаты Lightning были отмечены в тестах, ориентированных на агентов. В GDPval-AA v2 Artificial Analysis зафиксировала рейтинг Elo 824, по сравнению с 800 у gpt-oss-120b и 698 у Nemotron 3 Super. В Terminal-Bench v2.1 оценка модели выросла с 7 процентов у предшественника до 24,3 процента, приблизившись к сообщённым 26,2 процента у gpt-oss-120b.
Эти цифры получены независимой платформой бенчмаркинга, но здесь представлены через освещение The Decoder, а не как полный набор независимо воспроизведённых результатов в предоставленных материалах. Поэтому их следует рассматривать как снимки бенчмарков, а не как доказательство того, что Lightning будет превосходить более крупные модели во всех производственных нагрузках. Скорость инференса может существенно варьироваться в зависимости от оборудования, размера батча, квантизации, серверного ПО, длины промпта и длины вывода.
Главная цифра пропускной способности тоже получена в предрелизном тестировании с финальными весами NVFP4. The Decoder сообщил, что Lightning завершил задачу Intelligence Index примерно за полминуты, против примерно 3,5 минут у Qwen3.6 35B A3B и 5,8 минут у Gemma 4 31B в цитируемом сравнении. Эти времена помогают понять цель Nvidia: повторяющиеся, чувствительные к задержке задачи, где стоимость ожидания или обслуживания более крупной модели накапливается в течение многих взаимодействий.
Для продуктовых команд Lightning предлагает возможный промежуточный слой между небольшими, недорогими моделями и крупными системами, которые оставляют для сложных рассуждений. Компания может использовать его для рутинных шагов агентов — классификации, выбора инструментов, навигации по коду, поиска документов или структурированного выполнения — и при этом передавать неоднозначные или высокорисковые случаи более способной модели.
Такая архитектура может сократить число запросов к дорогим закрытым API, но только если меньшая модель надёжно работает в конкретном рабочем процессе. Преимущество на Terminal-Bench автоматически не превращается в надёжные изменения баз данных, финансовый анализ, действия службы поддержки или производственный код. Командам потребуется тестировать восстановление после сбоев, точность использования инструментов, частоту галлюцинаций и то, как часто задачи требуют эскалации.
Разреженная конструкция и опция NVFP4 также могут повлиять на экономику развёртывания. Активирование 3,6 млрд параметров на шаг может снизить вычислительные требования по сравнению с плотной моделью сопоставимого общего размера, а квантизация — уменьшить требования к памяти. Практическая польза будет зависеть от того, есть ли у команды совместимое оборудование и инфраструктура обслуживания, а также от накладных расходов, связанных с длинным контекстом, батчингом и оркестрацией агентов.
В релизе видна и более широкая стратегия Nvidia. Компания ранее утверждала, что модели с менее чем 10 млрд активных параметров могут решать многие задачи агентов за долю стоимости гораздо более крупных систем. Lightning превращает этот тезис об эффективности в продукт с дизайном в стиле mixture на 31,6 млрд параметров, но с активным путём в 3,6 млрд.
Связанный релиз Fastino Labs даёт ранний сигнал о возможном дальнейшем использовании. StreetInsider сообщил, что компания выпустила специализированные open-weight модели для финансов и здравоохранения, дообученные на Nemotron 3.5 Lightning полностью с помощью агента. Предоставленный источник не даёт технических деталей, результатов оценки или цифр внедрения для этих моделей, поэтому это объявление лучше воспринимать как пример активности экосистемы, а не как доказательство спроса на уровне производства.
Самым важным последующим шагом будет независимое тестирование сквозной надёжности агентов. Разработчикам следует искать оценки, измеряющие завершённые задачи, а не только токеновую пропускную способность или баллы бенчмарков, в кодировании, веб-сёрфинге, корпоративном ПО и длительных рабочих процессах.
Экономика обслуживания станет ещё одним ключевым сигналом. Публичные развёртывания могут показать, дают ли NVFP4 и разреженная активация ощутимую экономию на реальных нагрузках, особенно когда модели должны обрабатывать большие контексты или множество одновременных пользователей. Разница в производительности между локальным развёртыванием и hosted-инференсом тоже будет важна для компаний, балансирующих между контролем и операционной простотой.
Партнёрства Nvidia по посттренингу тоже стоит отслеживать. Artificial Analysis сообщила, что CodeRabbit и Harvey работали с Nvidia над доменно-специфическим посттренингом. Более специализированные варианты могут определить, станет ли Lightning универсальной моделью агента или основой для узких, высоконагруженных систем.
Наконец, покупателям следует следить за ясностью лицензирования, поддержкой инструментов и поведением модели в условиях ограничений безопасности. Open-weight модель проще проверять и развёртывать, чем закрытый API, но организации по-прежнему несут ответственность за мониторинг, контроль доступа, обработку данных и сдерживание сбоев.
Nemotron 3.5 Lightning — это не попытка Nvidia возглавить рейтинг «сырого интеллекта». Это ставка на то, что многим полезным ИИ-агентам нужна быстрая, повторяемая работа больше, чем лучший возможный ответ на каждую задачу.
Это делает релиз стратегически важным даже там, где лидеры бенчмарков остаются впереди. Если заявленная пропускная способность сохранится в типовых сценариях развёртывания, Lightning может дать разработчикам практичный вариант маршрутизации для массовых агентных шагов. В конечном счёте его успех будут оценивать не по числу параметров, а по тому, смогут ли команды выполнять реальные рабочие процессы с меньшей задержкой и стоимостью, не добавляя неприемлемых рисков надёжности или безопасности.
Nemotron 3.5 Lightning от Nvidia использует разреженную активацию и квантизацию, чтобы обеспечить быструю open-weight-инференцию, ориентируясь на массовых ИИ-агентов, а не на максимальные оценки.