AI News

NVIDIA says its Groq 3 LPX inference accelerator has entered full production as part of the Vera Rubin platform, giving cloud providers and enterprise infrastructure teams a specialized option for generating tokens quickly in long-context, agent-driven workloads.

The announcement positions Groq 3 LPX as a companion to NVIDIA’s Vera Rubin NVL72 rather than a replacement for its general-purpose GPUs. Rubin GPUs are intended to handle context processing, while the LPX system focuses on the latency-sensitive decode phase in which models produce responses one token at a time. That distinction matters as AI applications move from single-turn answers toward agents that repeatedly reason, call tools, exchange information with other systems and maintain large working contexts.

Производственная система, нацеленная на задержку декодирования

NVIDIA описывает Groq 3 LPX как интерактивный ускоритель инференса, разработанный для самых отзывчивых уровней обслуживания в своей архитектуре Vera Rubin. Согласно документации для разработчиков NVIDIA, развертывание на уровне стойки может включать 256 ускорителей LP30, соединенных прямыми chip-to-chip-связями, с 128 ГБ совокупной памяти на базе SRAM.

Система использует детерминированную модель выполнения, планируемую компилятором. Вместо того чтобы в значительной степени полагаться на арбитраж в реальном времени для решения, когда данные перемещаются между процессорами, компилятор может планировать вычисления и коммуникации до начала рабочей нагрузки. NVIDIA утверждает, что это снижает накладные расходы на координацию, из-за которых тензорный параллелизм может быть менее полезен при очень маленьких размерах пакетов.

Такой дизайн нацелен на конкретную слабость в обслуживании агентного ИИ. Агенту может потребоваться генерировать множество коротких ответов в рамках одной задачи, и каждый ответ запускает новый вызов инструмента, очередной ход модели или операцию с базой данных. Небольшие задержки в генерации токенов могут накапливаться на протяжении этих шагов. Долгие сессии также многократно возвращают расширяющийся контекст обратно в модель, что затрудняет отзывчивость даже тогда, когда базовая модель способна.

Архитектура NVIDIA распределяет работу по всей платформе. Vera Rubin NVL72 обрабатывает крупномасштабный контекст, а Groq 3 LPX ускоряет генерацию токенов. Компания говорит, что обе системы также могут поддерживать такие конфигурации, как разделение prefill-decode, разделение attention-FFN и speculative decoding с внешним drafter.

Что показывают бенчмарки

NVIDIA сообщает, что система, объединяющая Groq 3 LPX и Vera Rubin NVL72, достигла 3 431 выходного токена в секунду в бенчмарке 100K-context от Artificial Analysis с использованием Gemma 4 31B. В отдельном объявлении NVIDIA округлила результат до 3 400 токенов в секунду и заявила, что это в четыре раза быстрее ближайшей альтернативной платформы.

Это самые сильные заявления о производительности среди доступных материалов, и к ним следует относиться с оговорками. Результат бенчмарка приводится NVIDIA со ссылкой на Artificial Analysis, а сравнительное утверждение «в четыре раза быстрее» также исходит от NVIDIA. В публикации для разработчиков это названо первым сторонним бенчмарком систем Groq 3 LPX, но предоставленные источники не дают полной конфигурации теста, данных о конкурирующих платформах или независимо воспроизведенных результатов.

NVIDIA также ссылается на медианный результат 4 767 выходных токенов в секунду в SPEED-Bench для общих агентных и кодинговых нагрузок. Эта цифра также представлена в материалах NVIDIA для разработчиков. Ее не следует считать универсальной скоростью обслуживания: реальная производительность будет зависеть от архитектуры модели, длины контекста, параллельности, планирования, точности, сети и окружающего программного стека.

Тем не менее акцент бенчмарков значим. Обычные сравнения ускорителей часто делают упор на суммарную пропускную способность или скорость обучения. NVIDIA же выделяет скорость вывода при 100 000 токенов контекста и при малых размерах пакетов — условиях, которые ближе к интерактивным агентам, чем к массовому офлайн-инференсу. Для продуктовых команд это может быть более релевантной метрикой, когда пользователи ждут, пока агент завершит цепочку действий.

Первые сигналы внедрения по-прежнему исходят от самого вендора

NVIDIA называет Nebius первым облачным провайдером AI, который принял Groq 3 LPX. Компания говорит, что Nebius добавит этот ускоритель в свой сервис Token Factory, позволяя разработчикам создавать интерактивных агентов, кодовые системы и другие приложения реального времени в масштабе. В материалах не указаны масштаб развертывания Nebius, дата коммерческой доступности или обязательства клиентов.

NVIDIA также утверждает, что CoreWeave внедрила Spectrum-X Multiplane в производство для соединения стоек Vera Rubin через несколько параллельных коммутаторов. Это заявление касается сетевого уровня вокруг платформы, а не доказательства того, что CoreWeave развернула сам Groq 3 LPX.

Третий сигнал об adoption приходит от SpaceXAI, которая, по словам NVIDIA, планирует использовать процессоры Vera в своей архитектуре агентного ИИ следующего поколения. Указанные сценарии включают оркестрацию, использование инструментов, выполнение кода, обработку данных и симуляцию, с развертыванием в дата-центрах и на орбитальных спутниках. Это план компании, переданный NVIDIA, а не доказательство завершенного производственного внедрения.

Поскольку доступные сообщения в основном основаны на собственном блоге NVIDIA и материалах для разработчиков, adoption следует рассматривать как анонсированную активность экосистемы, а не как независимо подтвержденную рыночную динамику. Источник SiliconANGLE подтверждает новостной угол, но в предоставленных материалах не содержит дополнительного текста статьи или подробностей репортажа.

Почему это железо важно для разработчиков ИИ

Для разработчиков ИИ-приложений самый насущный вопрос не в том, высока ли пиковая скорость генерации токенов у Groq 3 LPX. Вопрос в том, может ли платформа обеспечивать предсказуемую задержку, когда агент работает на протяжении многих ходов и большого контекстного окна.

Это может сделать систему актуальной для ассистентов программирования, исследовательских агентов, рабочих процессов поддержки клиентов и систем оркестрации, где пользователь ощущает задержку каждого промежуточного ответа модели. Более быстрое декодирование может улучшить субъективную отзывчивость, а детерминированное планирование может облегчить планирование мощностей, если производительность менее чувствительна к конкуренции за ресурсы и издержкам координации при малых пакетах.

Обратная сторона — архитектурная сложность. Groq 3 LPX подается как расширение Vera Rubin NVL72, а не как plug-and-play ускоритель, который можно оценивать независимо от хост-платформы, ее интерконнекта, компилятора и ПО для обслуживания модели. Покупателям придется оценивать всю систему: объем памяти для длинных контекстов, топологию сети, совместимость моделей, загрузку при ожидаемом трафике и стоимость перемещения нагрузок между ресурсами prefill и decode.

Позиция NVIDIA также отражает более широкий сдвиг в экономике инфраструктуры. По мере того как агенты генерируют больше токенов и выполняют больше инференс-ходов, стоимость обслуживания и задержка могут стать более серьезными ограничениями, чем первоначальные затраты на обучение модели. Специализированный движок декодирования может повысить эффективность интерактивных нагрузок, но снизит ли он общую стоимость, зависит от того, насколько стабильно провайдер сможет загружать и Rubin GPU, и ускорители LPX.

На что смотреть дальше

Следующие полезные сигналы придут из независимых тестов, публикующих полные конфигурации, конкурирующие системы, версии моделей, настройки точности, длины контекста и уровни конкуренции. Результаты при нескольких размерах пакетов помогут понять, распространяется ли преимущество Groq 3 LPX за пределы высокоинтерактивного обслуживания при малых пакетах.

Разработчикам также стоит следить за признаками производственной доступности через Nebius Token Factory, включая поддерживаемые модели, цены, гарантии уровня обслуживания и возможность доступа к системе без внедрения более широкого стека Vera Rubin. Подтвержденные внедрения у CoreWeave или других облачных провайдеров дали бы более ясное представление о коммерческой тяге.

Наконец, рынку нужно увидеть, как NVIDIA интегрирует компилятор, сеть и ПО для обслуживания с распространенными агентными фреймворками. Техническое обещание зависит от координации выполнения модели, управления KV-cache, вызовов инструментов и многоагентного трафика, а не только от ускорения отдельных шагов декодирования.

Позиция Creati.ai

Groq 3 LPX примечателен тем, что NVIDIA нацелилась на узкое место, которое становится заметным только тогда, когда модели помещаются в длинные агентные циклы: накопленную задержку при генерации множества последовательных токенов при сохранении большого контекста. Это объявление меньше про запуск отдельного чипа и больше про разделение инференса на специализированные этапы в системе на уровне стойки.

Возможность значительна для провайдеров, обслуживающих интерактивных агентов, но доказательная база по-прежнему в основном контролируется вендором. Пока независимые бенчмарки и внедрения у клиентов не прояснят общую стоимость владения, требования к ПО и устойчивую производительность на реальных нагрузках, Groq 3 LPX следует рассматривать как технически сфокусированное производственное предложение с многообещающим, но еще не полностью подтвержденным рыночным эффектом.

Рекомендуемые

NVIDIA выводит Groq 3 LPX в полное производство для AI-инференса с длинным контекстом

NVIDIA заявляет, что Groq 3 LPX находится в полном производстве вместе с Vera Rubin и нацелен на более быстрый длинноконтекстный инференс для AI-агентов и многошаговых сценариев.