NVIDIA вывела Groq 3 LPX в полноценное производство вместе с Vera Rubin, нацелившись на более быстрый вывод с длинным контекстом для агентов и облачных ИИ-провайдеров.

NVIDIA заявляет, что её система инференса Groq 3 LPX перешла в полноценное производство и интегрируется с rack-scale платформой Vera Rubin NVL72. Эта комбинация предназначена для ускорения генерации токенов в агентных приложениях, где модели многократно рассуждают, вызывают инструменты и обрабатывают всё более длинные истории диалога или задач.
Это объявление расширяет стратегию NVIDIA Vera Rubin за пределы ускоренных вычислений общего назначения. Компания позиционирует GPU Rubin для обработки больших контекстов, а Groq 3 LPX — для чувствительного к задержкам декодирования, то есть этапа, на котором модель генерирует ответ по одному токену за раз. Такое разделение ориентировано на облачных ИИ-провайдеров и компании, которым нужны более отзывчивые агенты без отказа от пропускной способности в крупных развёртываниях.
По словам NVIDIA, Groq 3 LPX — это интерактивный ускоритель ИИ-инференса, предназначенный для работы совместно с Vera Rubin NVL72, а не для его замены. Компания описывает платформу как сочетание GPU и LPU, или local processing units, при этом каждый компонент назначается на те нагрузки, где он наиболее эффективен.
Необходимость такого разделения обусловлена поведением агентных нагрузок. Агент может сгенерировать ответ, использовать внешний инструмент, получить новую информацию и начать ещё один цикл инференса. Каждый цикл может добавлять контекст к сессии, в итоге заставляя систему обрабатывать десятки или сотни тысяч токенов, при этом всё равно быстро выдавая ответ.
NVIDIA утверждает, что GPU Rubin могут справляться с большой нагрузкой по обработке контекста, тогда как Groq 3 LPX оптимизирован для производительности decode. Систему также можно настроить для prefill-decode disaggregation, attention-FFN disaggregation и speculative decoding с external drafter. Это инфраструктурные техники, которые делят задачи обслуживания модели или используют предсказанные токены для повышения скорости ответа.
Развёртывание на уровне rack-scale может включать 256 ускорителей LP30, соединённых прямыми chip-to-chip связями, сообщает NVIDIA. В документации для разработчиков компания описывает 128 ГБ объединённой SRAM на этих чипах и компилятор, который планирует вычисления и коммуникации до выполнения. Такой детерминированный подход предназначен для снижения накладных расходов на координацию, которые могут стать существенными при обслуживании моделей с малыми batch sizes.
Самые сильные заявления NVIDIA о производительности основаны на бенчмарке Artificial Analysis, то есть это сторонние измерения, цитируемые вендором, а не независимое доказательство широкой производительности в продакшене. На модели Gemma 4 31B с контекстом в 100 000 токенов Artificial Analysis измерила медианную скорость 3 431 output token в секунду на Groq 3 LPX, согласно блогу разработчиков NVIDIA.
В корпоративном объявлении NVIDIA округляет эту цифру до 3 400 output tokens per second и заявляет, что результат был в четыре раза быстрее ближайшей альтернативной платформы. Исходные материалы не указывают эту конкурирующую платформу в объявлении, поэтому сравнение нельзя независимо оценить на основе доступных данных.
Второй результат получен в SPEED-Bench, coding-бенчмарке с использованием Gemma 4. NVIDIA сообщает о медиане 4 767 output tokens per second и результате на 80-м перцентиле 5 520 tokens per second. Эти цифры описывают конкретные модель, контекст и методику тестирования; их не следует считать универсальной мерой производительности для разных моделей, размеров batch, длины контекста или шаблонов производственного трафика.
Техническое объяснение NVIDIA заключается в том, что Groq 3 LPX использует chip-to-chip communication, расписанную компилятором, и накладывает перемещение данных на вычисления. В традиционном параллельном инференсе распределение работы между процессорами может вносить затраты на синхронизацию и коллективную коммуникацию. NVIDIA утверждает, что предварительное планирование передач может устранить необходимость части realtime arbitration, особенно при малых batch sizes, характерных для высокоинтерактивного обслуживания.
Ни один из источников не предоставляет данных о количестве клиентских развёртываний, ценах, энергопотреблении, сроках общей доступности для разработчиков или независимо подтверждённой производственной загрузке. Представленные данные подтверждают продуктовые и архитектурные заявления NVIDIA, но пока не показывают, как система экономически работает в широком диапазоне коммерческих нагрузок.
NVIDIA указывает трёх партнёров, связанных с расширением Vera Rubin. Nebius описывается как первое AI cloud, которое внедряет Groq 3 LPX. NVIDIA говорит, что оборудование будет добавлено в Token Factory компании, чтобы разработчики могли создавать интерактивных агентов, системы для кодирования и другие приложения реального времени в масштабе.
CoreWeave, в свою очередь, по словам NVIDIA, уже развернула Spectrum-X Multiplane в production. Сетевая система соединяет стойки Vera Rubin через несколько параллельных коммутаторов, с заявленной целью обеспечить высокую пропускную способность и беспротокольную связь по всей инфраструктуре облака ИИ.
NVIDIA также сообщает, что SpaceXAI планирует использовать Vera CPUs в своей архитектуре agentic AI следующего поколения. Компания связывает эти CPU с оркестрацией, использованием инструментов, выполнением кода, обработкой данных и симуляцией, включая инфраструктуру, охватывающую наземные дата-центры и орбитальные спутники. Это заявленный план, а не доказательство того, что такое развёртывание уже работает в масштабе.
Эти упоминания партнёров показывают, что NVIDIA продаёт Vera Rubin как полноценный AI factory stack: CPU для оркестрации и общих задач, GPU для контекста и вычислений модели, ускорители Groq для быстрого декодирования и сеть для соединения компонентов. Коммерческая значимость будет зависеть от того, смогут ли клиенты развернуть этот стек эффективнее, чем отдельные пулы ускорителей, оптимизированные под разные этапы обслуживания.
Для создателей кодовых ассистентов, исследовательских агентов и систем обслуживания клиентов задержка decode ощущается пользователями напрямую. Более быстрый первый ответ или более быстрый промежуточный вывод может сделать многошаговый рабочий процесс более интерактивным, особенно когда агенту требуется выполнять множество последовательных вызовов.
Длинный контекст также меняет инфраструктурную экономику. Сессия, которая многократно перерабатывает свою историю, может потреблять значительные ресурсы памяти и вычислений, даже если сама модель не особенно велика. Дизайн NVIDIA нацелен на сочетание больших key-value caches, инференса с малыми batch sizes и частых коммуникаций между процессорами.
Практический вопрос для предприятий будет заключаться не столько в пиковом количестве токенов в секунду, сколько в уровне сервиса при реальном трафике. Покупателям нужно будет оценивать задержку при разных уровнях конкуренции, размерах контекста и архитектурах моделей, а также стоимость поддержания специализированной инференс-мощности в активном использовании. Система, исключительно быстрая в бенчмарк-нагрузке, может оказаться менее привлекательной, если спрос нестабилен или приложения требуют моделей и ПО, ещё не оптимизированных под платформу.
Объявление также усиливает конкуренцию вокруг специализации инференса. NVIDIA использует более широкий охват своей платформы, чтобы связать специализированный low-latency accelerator со своими будущими GPU, CPU и сетевыми продуктами. Это может быть привлекательно для облачных провайдеров, строящих дифференцированные inference services, но также увеличивает сложность ПО и эксплуатации по сравнению с одной архитектурой ускорителя.
Самым ясным сигналом станет то, откроет ли Nebius разработчикам сервисы на базе Groq 3 LPX и опубликует ли данные о производительности в продакшене, ценах или ёмкости. Эти детали помогут отличить анонс железа от действительно доступного сервиса.
Клиентам также стоит следить за независимыми результатами помимо Gemma 4 31B и опубликованного coding-бенчмарка. Результаты на более крупных и более компактных моделях, при разных длинах контекста, числе одновременных пользователей и полных агентных рабочих процессах дадут более прочную основу для оценки платформы.
Данные о развёртывании от CoreWeave и SpaceXAI станут ещё одним важным индикатором. NVIDIA подтвердила production network deployment у CoreWeave и описала планы SpaceXAI по Vera CPU, но источники не приводят данных о масштабе, нагрузке или уровне использования. Энергоэффективность, поддержка ПО и совместимость с популярными фреймворками инференса также определят, получит ли архитектура распространение за пределами партнёров, названных NVIDIA.
Новость NVIDIA лучше всего понимать как веху в производстве и системной интеграции, а не просто как запуск ещё одного чипа для инференса. Компания отвечает на конкретную проблему обслуживания: агенты генерируют длинные цепочки токенов, сохраняя большой контекст, поэтому и задержка decode, и накладные расходы на interconnect имеют коммерческое значение.
Сообщённые результаты выглядят многообещающе, но остаются ограниченными бенчмарками, выбранными вендором, и ограниченными публичными данными о развёртывании. Для ИИ-команд важным тестом будет то, обеспечат ли Groq 3 LPX и Vera Rubin предсказуемую задержку и приемлемую экономику на их собственных агентных нагрузках. Если да, интегрированный подход NVIDIA в виде «token factory» может стать серьёзным вариантом для высокоинтерактивных сервисов; если нет, специализированные компоненты по-прежнему будет трудно оправдать, несмотря на сильные пиковые показатели.