
Alibaba выпустила открытые веса Qwen3.8-2.4T-A95B — модели mixture-of-experts с 2,4 триллиона параметров, а NVIDIA опубликовала путь развертывания для запуска этой модели на собственной rack-scale системе GB300 NVL72. В объявлении очень крупная open-weight модель оказывается в центре аппаратно-программного serving-стека, предназначенного для длинного контекстного reasoning и agentic-приложений.
Модель активирует 95 миллиардов параметров на токен, а не использует полное число параметров при каждом запросе. NVIDIA заявляет, что ее начальное FP8-развертывание может обеспечивать более 4 000 токенов в секунду на GPU и более 350 токенов в секунду на пользователя на GB300 NVL72, хотя эти показатели получены в ходе внутренних тестов инфраструктуры NVIDIA и не должны рассматриваться как независимые бенчмарки.
Qwen3.8-2.4T-A95B, в статье NVIDIA также называемая Qwen3.8-Max, позиционируется для кодинга, крупномасштабного анализа документов и многошаговых agentic-нагрузок. Согласно NVIDIA, релиз Alibaba делает веса модели доступными через Hugging Face и ModelScope.
Архитектура сочетает тонко настроенную маршрутизацию mixture-of-experts с чередующимися слоями full-attention и linear-attention. Обученный роутер выбирает экспертов, необходимых для каждого токена, благодаря чему стоимость serving модели зависит скорее от активных параметров, чем от всей емкости в 2,4T параметров.
Такая схема attention решает конкретную проблему agentic-систем: контекст может накапливать системные инструкции, результаты инструментов, найденные документы, исходный код, логи и промежуточные рассуждения на протяжении многих ходов. NVIDIA говорит, что модель поддерживает окно контекста до одного миллиона токенов и вывод до 128K токенов. Ее слои linear-attention используют ограниченное рекуррентное состояние вместо растущего key-value-кэша, тогда как слои full-attention сохраняют более широкое взаимодействие токенов там, где это необходимо.
Эти возможности важны для продуктовых команд, создающих агентов, которые должны сохранять состояние в течение длительных рабочих процессов. Они также поднимают практические инфраструктурные вопросы, поскольку контекст в один миллион токенов может сместить узкое место от чистых вычислений модели к памяти, коммуникации и управлению кэшем.
GB300 NVL72 от NVIDIA объединяет 72 GPU Blackwell Ultra в единую rack-scale платформу. По данным NVIDIA, система обеспечивает 72-GPU домен NVLink с 130 TB/s all-to-all коммуникации. Такое соединение важно для крупной MoE-модели, поскольку маршрутизация запросов к экспертам через обычные серверные сети может создавать коммуникационные накладные расходы и неравномерную загрузку.
Следовательно, serving Qwen3.8-2.4T-A95B зависит не только от размещения файлов модели на наборе ускорителей. Развертывание требует распределенного выполнения, оптимизированных ядер и inference runtime, способного координировать трафик экспертов по всему rack. В блоге NVIDIA конфигурация GB300 представлена как способ сделать эту координацию частью системного дизайна, а не полагаться лишь на готовую сеть.
NVIDIA утверждает, что опубликованные результаты Day 0 были достигнуты в FP8 без дополнительной настройки модели. Компания ожидает дальнейшего прироста от NVFP4 precision, но в предоставленном объявлении не указала будущий показатель производительности. Выполнение в FP8 и более низкой точности может снизить требования к памяти и вычислениям, однако покупателям в продакшене все равно придется оценивать качество вывода, численную устойчивость и операционные затраты полного rack-scale развертывания.
Примечательная функция продукта — встроенные controls reasoning у Qwen3.8-2.4T-A95B. По словам NVIDIA, разработчики могут выбирать режимы reasoning low, high или xhigh для каждого запроса. Эти controls призваны позволить приложениям менять глубину inference на качество ответа и задержку.
Это с операционной точки зрения полезнее, чем считать reasoning фиксированной глобальной настройкой. Кодинговый агент, решающий неоднозначную архитектурную задачу, может использовать более высокий режим, тогда как pipeline обработки документов может снизить глубину reasoning, чтобы максимизировать throughput. В корпоративных системах выбор также может быть связан с приоритетом задачи, уровнем пользователя или бюджетом по задержке приложения.
Эти controls не устраняют необходимость оценки. Командам нужно будет измерить, улучшают ли более высокие настройки reasoning завершение задач настолько, чтобы оправдать дополнительный compute, и сохраняют ли более низкие настройки точность на повторяющихся нагрузках. В объявлении нет независимого анализа различий в качестве между тремя режимами.
Основное доказательство этого развертывания исходит из публикации в NVIDIA Developer Blog, что делает NVIDIA источником чисел производительности, описания системы и рекомендаций по serving. Отдельная запись NVIDIA Developer указывает на то же объявление, но не добавляет независимого журналистского материала. Доступные источники не содержат результатов сторонних бенчмарков, клиентских внедрений или подтвержденного продакшен-использования.
NVIDIA перечисляет SGLang, vLLM и NVIDIA Dynamo как open-source inference варианты для разработчиков, которым нужен контроль над serving-производительностью. Компания также предлагает NVIDIA NIM, описанный в посте как model-free inference container, способный обслуживать поддерживаемые модели. Предполагаемый рабочий процесс — загрузить веса модели, развернуть их через контейнер и масштабировать сервис по необходимости.
Для кастомизации NVIDIA рекомендует NVIDIA NeMo AutoModel. По словам компании, native для PyTorch библиотека fine-tuning поддерживает прямое использование Hugging Face checkpoints, полное supervised fine-tuning и адаптацию на основе LoRA. Это дает командам возможный путь от публичного checkpoint к доменно-специфичным версиям, но размеры модели означают, что обучение, хранение checkpoints и оценка по-прежнему остаются крупными инфраструктурными проектами.
Показатели “более 4K токенов в секунду на GPU” и “более 350 токенов в секунду на пользователя” особенно важно интерпретировать осторожно. NVIDIA обозначает их как Day 0 результаты на собственном hardware-and-software stack. Они показывают целевую производительность рецепта развертывания, а не универсальный результат, который можно без изменений перенести на другие серверы, настройки точности, профили batch или прикладные workloads.
Для AI-разработчиков объявление расширяет open-weight пространство дизайна в сторону моделей, общая емкость которых измеряется триллионами параметров, при том что активация на токен остается ниже. Это может поддержать специализированный reasoning и agentic-поведение без необходимости, чтобы плотная 2,4T модель выполняла каждый параметр на каждом токене.
Однако порог по оборудованию высок. Rack-scale платформа с 72 GPU — не типичная среда разработки, и командам придется учитывать загрузку, планирование, репликацию модели, восстановление после отказов и энергозатраты наряду с показателями токенов в секунду. Модель может быть технически открытой, но эксплуатация на заявленном масштабе, вероятно, будет сосредоточена у хорошо финансируемых компаний, облачных провайдеров и исследовательских организаций с доступом к передовой инфраструктуре.
Развертывание также показывает растущий разрыв между открытостью модели и ее операционной доступностью. Open weights могут сделать возможными эксперименты и fine-tuning, но serving длинного контекста и крупномасштабная MoE-коммуникация по-прежнему зависят от специализированных систем. Покупателям, оценивающим модель, следует сравнивать end-to-end стоимость на завершенную задачу, а не только скорость генерации. Им также стоит тестировать использование инструментов, retrieval в длинном контексте, надежность в многошаговых запусках и поведение при разных настройках reasoning.
Самым четким последующим сигналом станет независимое тестирование Qwen3.8-2.4T-A95B в SGLang, vLLM и NVIDIA Dynamo, включая задержку, throughput, использование памяти и качество на каждом уровне reasoning. Сравнения с другими open-weight моделями покажут, дает ли архитектура практические преимущества помимо числа параметров.
Разработчикам также стоит следить за обещанными NVFP4-оптимизациями, дополнительными рецептами развертывания и доказательствами из реальных production-workloads. Использование весов модели, дообученных checkpoints и agentic-приложений с длинным контекстом будет значимее, чем просто активность загрузок. Наконец, стоимость и доступность систем GB300 NVL72 определят, останется ли это в первую очередь демонстрацией rack-scale инфраструктуры или превратится в широко применимый serving-вариант.
Значимость объявления NVIDIA заключается не столько в том, что оно делает модель с 2,4T параметров повсеместно доступной, сколько в том, что демонстрирует, как open weights, MoE routing, настраиваемый reasoning и rack-scale interconnects проектируются вместе. Развертывание рассматривает inference как системную задачу, где коммуникация и память становятся столь же важны, как и арифметика ускорителей.
Для продуктовых команд практический вопрос не в том, может ли самая большая модель быстро генерировать токены. Вопрос в том, улучшают ли ее controls reasoning и long-context архитектура конкретный workflow настолько, чтобы оправдать специализированную инфраструктуру. Пока не появятся независимые бенчмарки и доказательства из продакшена, Qwen3.8-2.4T-A95B лучше всего рассматривать как перспективную открытую модель в сочетании с описанной вендором схемой serving, а не как проверенный стандарт для корпоративного развертывания.
NVIDIA объясняет, как open-weight модель Alibaba Qwen3.8 работает на GB300 NVL72, с настраиваемым reasoning для крупномасштабных agentic-нагрузок.