AI News

Nvidia выпустила Nemotron 3.5 Lightning — open-weight модель рассуждений, предназначенную для того, чтобы сделать рабочие нагрузки ИИ-агентов быстрее и дешевле в эксплуатации, а не для максимизации результата по каждому бенчмарку на интеллект.

Модель сочетает 31,6 млрд общих параметров с разреженной архитектурой, которая активирует только 3,6 млрд параметров на каждый токен. По данным бенчмаркинга, о котором сообщил The Decoder, в предрелизном тестировании с финальными весами NVFP4 от Nvidia она достигает почти 670 токенов в секунду, делая пропускную способность центральной особенностью нового релиза Nemotron 3.5.

Такое позиционирование важно по мере того, как разработчики переходят от разовых запросов чат-бота к агентным системам, которые генерируют длинные последовательности вызовов инструментов, кода и промежуточных рассуждений. Для таких нагрузок задержка, использование оборудования и стоимость обслуживания могут быть не менее важны, чем максимальный балл модели в бенчмарках.

Меньший активный след при контексте в один миллион токенов

Nemotron 3.5 Lightning приходит на смену Nemotron 3 Nano 30B A3B и сохраняет гибридную архитектуру Mamba-Transformer предыдущей модели. Общее число параметров существенно больше числа, используемого в любом отдельном вычислении, — такая структура призвана дать больше мощности без полного вычислительного расхода плотной модели с 31,6 млрд параметров.

Nvidia предлагает модель рассуждений в форматах BF16 и NVFP4. Последний использует веса с более низкой точностью, чтобы сократить память и вычисления, необходимые для инференса. The Decoder сообщил, что NVFP4 показал тот же результат, что и версия BF16, в Artificial Analysis Intelligence Index, при этом разница в качестве по этой оценке была небольшой.

Модель текстовая и поддерживает окно контекста до одного миллиона токенов. Такой объём может быть полезен для кодовых агентов, документно-ориентированных рабочих процессов и приложений, которым нужно сохранять большой объём истории задач, хотя сам по себе размер контекста не показывает, насколько эффективно и надёжно система будет обрабатывать очень длинные входы.

Весы доступны по разрешительной лицензии OpenMDW-1.1 от Nvidia. The Decoder также перечислил серверный доступ через таких провайдеров, как DeepInfra, Fireworks, FriendliAI, CoreWeave, GMI Cloud, Nebius и Crusoe. Доступность на нескольких платформах инференса снижает барьер для команд, которые хотят протестировать модель, не разворачивая сразу собственную инфраструктуру Nvidia.

Скорость — главный продуктовый тезис; интеллект конкурентоспособен, но не доминирует

По сообщению The Decoder, Artificial Analysis присвоила Nemotron 3.5 Lightning 24 балла в Intelligence Index. Это совпало с показателем OpenAI gpt-oss-120b и уступило Nvidia Nemotron 3 Super, который набрал 26. Результат означал улучшение на девять пунктов по сравнению с сообщённой оценкой Nemotron 3 Nano в 15.

Сравнение также показывает пределы подхода Nvidia. The Decoder сообщил о более высоких результатах у Qwen3.6 35B A3B и Muse Glimmer от Meta — 32 и 35 соответственно. В цитируемом анализе закрытые системы по-прежнему опережали по совокупному компромиссу скорости и интеллекта: Google Gemini 3.5 Flash-Lite, по сообщениям, набрал 37, а GPT-5.6 Luna достиг 52.

Наиболее сильные результаты Lightning были отмечены в тестах, ориентированных на агентов. В GDPval-AA v2 Artificial Analysis зафиксировала рейтинг Elo 824, по сравнению с 800 у gpt-oss-120b и 698 у Nemotron 3 Super. В Terminal-Bench v2.1 оценка модели выросла с 7 процентов у предшественника до 24,3 процента, приблизившись к сообщённым 26,2 процента у gpt-oss-120b.

Эти цифры получены независимой платформой бенчмаркинга, но здесь представлены через освещение The Decoder, а не как полный набор независимо воспроизведённых результатов в предоставленных материалах. Поэтому их следует рассматривать как снимки бенчмарков, а не как доказательство того, что Lightning будет превосходить более крупные модели во всех производственных нагрузках. Скорость инференса может существенно варьироваться в зависимости от оборудования, размера батча, квантизации, серверного ПО, длины промпта и длины вывода.

Главная цифра пропускной способности тоже получена в предрелизном тестировании с финальными весами NVFP4. The Decoder сообщил, что Lightning завершил задачу Intelligence Index примерно за полминуты, против примерно 3,5 минут у Qwen3.6 35B A3B и 5,8 минут у Gemma 4 31B в цитируемом сравнении. Эти времена помогают понять цель Nvidia: повторяющиеся, чувствительные к задержке задачи, где стоимость ожидания или обслуживания более крупной модели накапливается в течение многих взаимодействий.

Что означает релиз для создателей ИИ

Для продуктовых команд Lightning предлагает возможный промежуточный слой между небольшими, недорогими моделями и крупными системами, которые оставляют для сложных рассуждений. Компания может использовать его для рутинных шагов агентов — классификации, выбора инструментов, навигации по коду, поиска документов или структурированного выполнения — и при этом передавать неоднозначные или высокорисковые случаи более способной модели.

Такая архитектура может сократить число запросов к дорогим закрытым API, но только если меньшая модель надёжно работает в конкретном рабочем процессе. Преимущество на Terminal-Bench автоматически не превращается в надёжные изменения баз данных, финансовый анализ, действия службы поддержки или производственный код. Командам потребуется тестировать восстановление после сбоев, точность использования инструментов, частоту галлюцинаций и то, как часто задачи требуют эскалации.

Разреженная конструкция и опция NVFP4 также могут повлиять на экономику развёртывания. Активирование 3,6 млрд параметров на шаг может снизить вычислительные требования по сравнению с плотной моделью сопоставимого общего размера, а квантизация — уменьшить требования к памяти. Практическая польза будет зависеть от того, есть ли у команды совместимое оборудование и инфраструктура обслуживания, а также от накладных расходов, связанных с длинным контекстом, батчингом и оркестрацией агентов.

В релизе видна и более широкая стратегия Nvidia. Компания ранее утверждала, что модели с менее чем 10 млрд активных параметров могут решать многие задачи агентов за долю стоимости гораздо более крупных систем. Lightning превращает этот тезис об эффективности в продукт с дизайном в стиле mixture на 31,6 млрд параметров, но с активным путём в 3,6 млрд.

Связанный релиз Fastino Labs даёт ранний сигнал о возможном дальнейшем использовании. StreetInsider сообщил, что компания выпустила специализированные open-weight модели для финансов и здравоохранения, дообученные на Nemotron 3.5 Lightning полностью с помощью агента. Предоставленный источник не даёт технических деталей, результатов оценки или цифр внедрения для этих моделей, поэтому это объявление лучше воспринимать как пример активности экосистемы, а не как доказательство спроса на уровне производства.

Что отслеживать дальше

Самым важным последующим шагом будет независимое тестирование сквозной надёжности агентов. Разработчикам следует искать оценки, измеряющие завершённые задачи, а не только токеновую пропускную способность или баллы бенчмарков, в кодировании, веб-сёрфинге, корпоративном ПО и длительных рабочих процессах.

Экономика обслуживания станет ещё одним ключевым сигналом. Публичные развёртывания могут показать, дают ли NVFP4 и разреженная активация ощутимую экономию на реальных нагрузках, особенно когда модели должны обрабатывать большие контексты или множество одновременных пользователей. Разница в производительности между локальным развёртыванием и hosted-инференсом тоже будет важна для компаний, балансирующих между контролем и операционной простотой.

Партнёрства Nvidia по посттренингу тоже стоит отслеживать. Artificial Analysis сообщила, что CodeRabbit и Harvey работали с Nvidia над доменно-специфическим посттренингом. Более специализированные варианты могут определить, станет ли Lightning универсальной моделью агента или основой для узких, высоконагруженных систем.

Наконец, покупателям следует следить за ясностью лицензирования, поддержкой инструментов и поведением модели в условиях ограничений безопасности. Open-weight модель проще проверять и развёртывать, чем закрытый API, но организации по-прежнему несут ответственность за мониторинг, контроль доступа, обработку данных и сдерживание сбоев.

Взгляд Creati.ai

Nemotron 3.5 Lightning — это не попытка Nvidia возглавить рейтинг «сырого интеллекта». Это ставка на то, что многим полезным ИИ-агентам нужна быстрая, повторяемая работа больше, чем лучший возможный ответ на каждую задачу.

Это делает релиз стратегически важным даже там, где лидеры бенчмарков остаются впереди. Если заявленная пропускная способность сохранится в типовых сценариях развёртывания, Lightning может дать разработчикам практичный вариант маршрутизации для массовых агентных шагов. В конечном счёте его успех будут оценивать не по числу параметров, а по тому, смогут ли команды выполнять реальные рабочие процессы с меньшей задержкой и стоимостью, не добавляя неприемлемых рисков надёжности или безопасности.

Рекомендуемые

Nvidia Nemotron 3.5 Lightning делает ставку на быстрых и эффективных ИИ-агентов

Nemotron 3.5 Lightning от Nvidia использует разреженную активацию и квантизацию, чтобы обеспечить быструю open-weight-инференцию, ориентируясь на массовых ИИ-агентов, а не на максимальные оценки.