TensorRT Edge-LLM завершил MLPerf Edge Agentic Benchmark в 6,4 раза быстрее на Jetson AGX Thor

NVIDIA сообщает, что TensorRT Edge-LLM в 6,4 раза быстрее запускал Qwen3.6-27B на Jetson AGX Thor, подчеркивая преимущества кэша и квантизации для edge-агентов.

AI News

NVIDIA сообщает, что её runtime TensorRT Edge-LLM завершил бенчмарк MLPerf Inference v6.1 Edge Agentic за 24 минуты 36 секунд на одном Jetson AGX Thor Developer Kit. Это в 6,4 раза быстрее, чем опубликованный эталонный запуск llama.cpp на той же платформе, согласно блогу разработчиков NVIDIA.

Результат значим, потому что тест измеряет не только скорость одиночного ответа. Он воспроизводит разговоры software-engineering-агента, в которых модель генерирует вызовы инструментов, получает результаты и продолжает работу в условиях всё более длинных контекстов. Вклад NVIDIA запускал Qwen3.6-27B со скоростью 52,33 токена в секунду и завершил все 1 007 сгенерированных ходов в рабочей нагрузке производительности.

Эти цифры являются результатами, сообщёнными самим поставщиком в рамках подачи NVIDIA, и не должны рассматриваться как независимое сравнение всех edge-стеков инференса. Тем не менее они показывают, как оптимизации на уровне runtime могут изменить экономику работы многошаговых AI-агентов на локальном оборудовании вместо отправки каждого взаимодействия в облачный дата-центр.

Что измерял тест MLPerf

Бенчмарк MLPerf Edge Agentic оценивает OpenAI-совместимую модельную конечную точку в фазах производительности и точности. Его рабочая нагрузка производительности содержит 20 записанных диалогов и 1 007 сгенерированных ходов. По мере того как каждый агент получает результаты инструментов и продолжает рассуждение, контекст вырастает примерно до 23 500 токенов.

Такая структура создаёт узкое место, отличное от обычного теста чат-бота. Агент многократно обрабатывает большую часть одного и того же диалога, одновременно быстро создавая корректные вызовы функций. Пересчёт всей истории на каждом ходе может сделать длительные траектории всё более дорогими, особенно на устройстве с ограниченной пропускной способностью памяти и энергопотреблением.

Фаза точности использует промпты из Berkeley Function Calling Leaderboard, или BFCL, с одноходовыми запросами и отключённым reasoning. Она проверяет, выбирает ли модель подходящую функцию, предоставляет ли корректные аргументы или правильно ли отказывается вызывать инструмент. NVIDIA говорит, что её подача работала в режиме SingleStream на одном Jetson AGX Thor Developer Kit с 128 ГБ единой памяти в режиме питания MAXN платформы.

Инженерия, стоящая за результатом NVIDIA

NVIDIA объясняет результат несколькими оптимизациями в TensorRT Edge-LLM, а не одной аппаратной особенностью. Представленная модель Qwen3.6-27B использовала NVFP4 для весов и активаций, включая головную часть языковой модели, и FP8 для своего key-value cache, или KV cache.

NVFP4 — это четырёхбитный формат с плавающей запятой, поддерживаемый GPU Blackwell в Jetson AGX Thor. Более низкая точность уменьшает объём данных, которые ядрам нужно перемещать через память, что особенно важно для декодирования при малом batch, которое NVIDIA описывает как сильно ограниченное пропускной способностью DRAM на edge-платформах. Меньшее представление также оставляет больше единой памяти устройства для контекста, состояния speculative decoding и других задач приложения.

Runtime также повторно использовал кэшированное состояние диалога между ходами. NVIDIA заявляет, что примерно 96% токенов промпта были обслужены из горячего кэша на всей траектории агента. Вместо предварительной загрузки всех 13,6 миллиона токенов промпта, встреченных во время бенчмарка, система предварительно загрузила только около 0,5 миллиона токенов новых суффиксов диалога.

Эта оптимизация особенно важна для рабочих нагрузок агентов. Каждый новый ход содержит большую часть предыдущего диалога, плюс результат инструмента или ответ модели. TensorRT Edge-LLM определяет повторно используемые префиксы промпта и восстанавливает кэшированные страницы внимания. Поскольку Qwen3.6 использует гибридную архитектуру модели, NVIDIA говорит, что runtime также восстанавливает рекуррентное состояние и частичное состояние KV-страниц, необходимое для корректного продолжения выполнения.

Для генерации токенов NVIDIA использовала древовидное многотокенное предсказание. Конфигурация использовала восьмишаговое дерево проверки с top-two и 16 узлами и обеспечила примерно 40-процентное улучшение декодирования по сравнению с линейным многотокенным предсказанием для рабочей нагрузки function-calling, по словам компании.

Доказательства, сравнение и ограничения

Ключевое сравнение — между подачей NVIDIA TensorRT Edge-LLM и эталонным запуском llama.cpp, опубликованным через пример MLCommons Edge Agentic. Оба запуска использовали Qwen3.6-27B на Jetson AGX Thor, но эталон использовал квантование Q4_K_M, тогда как подача NVIDIA использовала NVFP4 и дополнительные runtime-техники.

NVIDIA сообщает, что запуск llama.cpp занял 2 часа 37 минут, чтобы выполнить ту же рабочую нагрузку. Результат TensorRT Edge-LLM занял 24 минуты 36 секунд. Следовательно, разница отражает весь программный стек, выбор квантизации, обработку кэша и стратегию декодирования — а не просто прямое сравнение одного формата модели с другим.

Бенчмарк также не доказывает, что система будет в 6,4 раза быстрее во всех агентских приложениях. Результаты могут варьироваться в зависимости от архитектуры модели, длины контекста, паттернов вызова инструментов, качества квантизации, настроек питания и объёма параллельной работы. Примерно 40-процентный выигрыш NVIDIA в многотокенном предсказании также является специфичным для этой нагрузки заявлением, привязанным к сообщённой конфигурации function-calling.

Наиболее сильные данные доступны по времени завершения и числу токенов в секунду в рамках этого определённого бенчмарка. Слабее доказательства по надёжности в продакшене, энергопотреблению, тепловому поведению при длительных развёртываниях и компромиссам точности в более широких агентских задачах. NVIDIA говорит, что разработчики могут изучить ветку TensorRT Edge-LLM release/0.9.1-mlpinf, использовать её откалиброванный checkpoint Qwen3.6-27B NVFP4 и ознакомиться с примером MLCommons для деталей конфигурации, но эти материалы сами по себе не являются независимым доказательством внедрения.

Почему это важно для создателей edge AI

Для разработчиков, встраивающих AI-агентов в транспорт, роботов, промышленное оборудование или другие встраиваемые системы, результат поднимает практический вопрос развёртывания: какую часть повторяющегося контекста агента можно хранить локально и повторно использовать? Повторное использование кэша может снизить объём работы по prefilling без изменения диалогового потока приложения, а многотокенное предсказание нацелено на фазу генерации после ответов инструментов.

Экономия памяти может быть не менее важной, чем чистая скорость. Модель с 27 миллиардами параметров, работающая в формате низкой точности, всё равно требует места для длинных контекстов, состояния runtime и логики приложения. Использование NVIDIA 128 ГБ единой памяти показывает, что edge-развёртывания всё чаще будут проектироваться вокруг совокупного footprint модели и агента, а не только модели.

Для корпоративных покупателей бенчмарк даёт сигнал, что локальный агентский инференс становится более жизнеспособным для сценариев, где важны задержка, связность или контроль данных. Он не отменяет необходимости оценивать энергопотребление, точность модели, надёжность вызовов инструментов, процессы обновления и механизмы безопасности в целевой среде. Более быстрый запуск бенчмарка полезен только в том случае, если агент способен принимать правильные решения и стабильно работать в реальных аппаратных ограничениях.

Результат также усиливает конкурентное давление на альтернативные runtime. Преимущество TensorRT Edge-LLM здесь обусловлено тесной координацией между ПО NVIDIA и железом Blackwell. Разработчикам, использующим другие ускорители, потребуется сопоставимая поддержка низкоточных ядер, постоянного состояния контекста и speculative или древовидного декодирования, если они хотят получить похожую производительность на длинных агентских траекториях.

На что смотреть дальше

Следующими полезными сигналами станут независимые воспроизведения результата MLPerf, особенно сравнения, которые сообщают об энергопотреблении, тепловых ограничениях и точности наряду со временем завершения. Также важно будет увидеть, сохраняется ли эффективность повторного использования кэша в рабочих нагрузках с менее повторяющимся контекстом или более разнообразными выходами инструментов.

Разработчикам следует следить за веткой релиза TensorRT Edge-LLM и примером MLCommons Edge Agentic на предмет обновлённой поддержки моделей, инструкций по сборке и дополнительных аппаратных подач. Более широкое тестирование Qwen3.6-27B NVFP4 поможет понять, практична ли заявленная производительность для production-агентов, а не только для записанных траекторий бенчмарка.

Наконец, данные из развёрнутых транспортных средств, роботов и промышленных систем дали бы более сильную проверку подхода. Такие среды включают прерывистую связность, жёсткие энергетические бюджеты, входные данные сенсоров, требования безопасности и обновления ПО, которые текущий бенчмарк не полностью охватывает.

Взгляд Creati.ai

Результат NVIDIA лучше всего понимать как демонстрацию системы: производительность edge-агентов зависит не только от увеличения сырой скорости генерации, но и от избавления от повторяющейся работы. Комбинация NVFP4, FP8 KV cache, повторного использования состояния и древовидного декодирования решает конкретные затраты, возникающие из-за длинных разговоров с использованием инструментов.

Показатель 6,4x убедителен в рамках заявленной конфигурации MLPerf, но более общий вывод осторожнее. Для создателей AI важный вопрос — сохраняются ли эти оптимизации при разных моделях, инструментах, энергетических ограничениях и реальных требованиях к точности. Если да, локальные развёртывания агентов смогут перейти от изолированных демонстраций к более убедительным production-архитектурам.

Реклама