TensorRT Edge-LLM、Jetson AGX Thor上でMLPerf Edge Agenticベンチマークを6.4倍高速で完了

NVIDIAは、TensorRT Edge-LLMがJetson AGX Thor上でQwen3.6-27Bを6.4倍高速で実行し、エッジエージェント向けのキャッシュと量子化の効果を示したと述べています。

AI News

NVIDIAは、自社のTensorRT Edge-LLMランタイムが、単体のJetson AGX Thor Developer Kit上でMLPerf Inference v6.1 Edge Agenticベンチマークを24分36秒で完了したと述べています。これは、同じプラットフォーム上で公開されているllama.cppの参照実行より6.4倍高速だったと、NVIDIAの開発者ブログは伝えています。

この結果が重要なのは、テストが単発応答の速度以上を測っているからです。モデルがツール呼び出しを生成し、結果を受け取り、より長いコンテキストを通じて処理を続けるソフトウェア工学エージェントの会話を再現しています。NVIDIAの提出ではQwen3.6-27Bを毎秒52.33トークンで実行し、性能ワークロード内の1,007の生成ターンをすべて完了しました。

この数値はNVIDIA自身の提出によるベンダー報告の結果であり、あらゆるエッジ推論スタックを独立に比較したものとして扱うべきではありません。それでも、ランタイムレベルの最適化が、すべてのやり取りをクラウドデータセンターに送るのではなく、ローカルハードウェア上で複数段階のAIエージェントを動かす経済性をどう変えうるかを示しています。

MLPerfテストが測定したもの

MLPerf Edge Agenticベンチマークは、OpenAI互換のモデルエンドポイントを性能フェーズと精度フェーズで評価します。性能ワークロードには20件の記録済み会話と1,007の生成ターンが含まれます。各エージェントがツール結果を受け取り、推論を続けるにつれて、コンテキストは約23,500トークンまで増加します。

この構造は、従来のチャットボットテストとは異なるボトルネックを生みます。エージェントは同じ会話の大部分を繰り返し処理しながら、有効な関数呼び出しを素早く生成する必要があります。毎ターン履歴全体を再計算すると、特にメモリ帯域幅と電力が限られたデバイスでは、長時間の軌跡がますます高コストになります。

精度フェーズでは、Berkeley Function Calling Leaderboard、つまりBFCLのプロンプトを用い、単一ターンのリクエストと推論無効の状態で評価します。モデルが適切な関数を選び、有効な引数を提供するか、あるいはツール呼び出しを正しく拒否するかを確認します。NVIDIAによると、同社の提出は、プラットフォームのMAXN電力モードで128 GBのユニファイドメモリを搭載した1台のJetson AGX Thor Developer Kit上でSingleStreamモードで実行されました。

NVIDIAの結果を支えたエンジニアリング

NVIDIAは、この結果は単一のハードウェア機能ではなく、TensorRT Edge-LLM内のいくつかの最適化によるものだとしています。提出されたQwen3.6-27Bモデルは、言語モデルヘッドを含む重みと活性化にNVFP4を使用し、キー・バリュー・キャッシュ、つまりKVキャッシュにはFP8を使用しました。

NVFP4は、Jetson AGX ThorのBlackwell GPUがサポートする4ビット浮動小数点フォーマットです。低精度表現は、カーネルがメモリを通じて移動させる必要のあるデータ量を減らします。これは、NVIDIAがエッジプラットフォームではDRAM帯域幅に強く制約されると説明する、低バッチのデコードにおいて重要です。より小さな表現はまた、コンテキスト、推測的デコードの状態、その他のアプリケーションタスクのために、デバイスのユニファイドメモリをより多く残します。

ランタイムはまた、ターン間でキャッシュされた会話状態を再利用しました。NVIDIAは、エージェントの全軌跡を通じて、プロンプトトークンのおよそ96%がホットキャッシュから提供されたと述べています。ベンチマーク中に発生した1,360万のプロンプトトークンをすべて事前投入する代わりに、システムは新しい会話サフィックスの約50万トークンのみを事前投入しました。

この最適化は、特にエージェントのワークロードに関連します。新しい各ターンには、それまでの会話の大部分に加え、ツール結果またはモデル応答が含まれます。TensorRT Edge-LLMは再利用可能なプロンプト接頭辞を識別し、キャッシュされたアテンションページを復元します。Qwen3.6はハイブリッドなモデルアーキテクチャを採用しているため、NVIDIAによれば、ランタイムは正しく実行を継続するために必要な再帰状態と部分的なKVページ状態も復元します。

トークン生成には、NVIDIAは木ベースのマルチトークン予測を使用しました。同社によれば、この構成は8ステップ、トップツー、16ノードの検証ツリーを用い、関数呼び出しワークロードに対して線形マルチトークン予測と比べて約40%のデコード改善を実現しました。

証拠、比較、限界

中心となる比較は、NVIDIAのTensorRT Edge-LLM提出と、MLCommons Edge Agenticの例を通じて公開されたllama.cppの参照実行との間です。両者ともJetson AGX Thor上でQwen3.6-27Bを使用しましたが、参照実行はQ4_K_M量子化を使い、NVIDIAの提出はNVFP4と追加のランタイム技術を使いました。

NVIDIAによると、llama.cppの実行には同じワークロードを完了するのに2時間37分かかりました。TensorRT Edge-LLMの結果は24分36秒でした。したがって、この差は、単にあるモデル形式と別のモデル形式を直接比較したものではなく、ソフトウェアスタック全体、量子化の選択、キャッシュ処理、デコード戦略を反映しています。

また、このベンチマークは、システムがすべてのエージェントアプリケーションで6.4倍高速になることを示すものではありません。結果は、モデルアーキテクチャ、コンテキスト長、ツール呼び出しのパターン、量子化品質、電力設定、並列作業量によって変動し得ます。NVIDIAの約40%のマルチトークン予測の改善も、報告された関数呼び出し構成に紐づくワークロード固有の主張です。

現時点で得られる証拠は、この定義されたベンチマークにおける完了時間と毎秒トークン数について最も強いものです。一方、実運用での信頼性、消費電力、長期展開における熱挙動、より広いエージェントタスクにおける精度のトレードオフについては薄いです。NVIDIAは、開発者がTensorRT Edge-LLMのrelease/0.9.1-mlpinfブランチを確認し、キャリブレーション済みのQwen3.6-27B NVFP4チェックポイントを使い、設定詳細についてMLCommonsの例を参照できると述べていますが、それらの資料だけでは独立した採用証拠にはなりません。

エッジAIビルダーにとってこの結果が重要な理由

車両、ロボット、産業機器、その他の組み込みシステムにAIエージェントを組み込む開発者にとって、この結果は実用的な展開上の問いを示します。エージェントの繰り返しコンテキストのうち、どれだけをローカルに保持し再利用できるのか、という点です。キャッシュ再利用はアプリケーションの会話フローを変えずに事前投入の作業を減らせますし、マルチトークン予測はツール応答の後に続く生成フェーズを狙います。

メモリ節約は、生の速度と同じくらい重要かもしれません。270億パラメータのモデルでも、低精度フォーマットで動かすには長いコンテキスト、ランタイム状態、アプリケーションロジックのための余地が必要です。NVIDIAが128 GBのユニファイドメモリを使っていることは、エッジ展開がモデル単体ではなく、モデルとエージェントの合計フットプリントを中心に設計されつつあることを示唆しています。

企業の購入者にとって、このベンチマークは、レイテンシー、接続性、データ制御が重要なワークフローでローカルなエージェント推論がより実用的になりつつあるというシグナルです。ただし、対象環境での消費電力、モデル精度、ツール呼び出しの信頼性、更新プロセス、安全対策を評価する必要がなくなるわけではありません。より速いベンチマーク実行は、エージェントが正しい判断を下し、実際のハードウェア制約下で一貫して動作できて初めて有用です。

この結果は、代替ランタイムへの競争圧力も高めます。ここでのTensorRT Edge-LLMの優位性は、NVIDIAのソフトウェアとBlackwellハードウェアの緊密な連携に由来します。他のアクセラレータを使う開発者が、長いエージェント軌跡で同様の性能を求めるなら、低精度カーネル、永続的なコンテキスト状態、推測的または木ベースのデコードに対する同等のサポートが必要になります。

今後注目すべき点

次に有益なシグナルとなるのは、MLPerf結果の独立再現です。特に、完了時間に加えて消費電力、熱制約、精度を報告する比較が重要になります。キャッシュ再利用が、より反復の少ないコンテキストやより多様なツール出力を持つワークロードでも有効かどうかを見ることも重要です。

開発者は、TensorRT Edge-LLMのリリースブランチとMLCommons Edge Agenticの例を監視し、更新されたモデルサポート、ビルド手順、追加のハードウェア提出を確認すべきです。Qwen3.6-27B NVFP4のより広範なテストは、報告された性能がベンチマークの記録された軌跡に限られず、本番エージェントにとって実用的かどうかを明らかにする助けになります。

最後に、実際に配備された車両、ロボット、産業システムからの証拠は、この手法をより強く検証します。そうした環境には、断続的な接続、厳しい電力予算、センサー入力、安全要件、ソフトウェア更新があり、現在のベンチマークでは完全には捉えられていません。

Creati.aiの視点

NVIDIAの結果は、システムデモンストレーションとして理解するのが最適です。エッジエージェントの性能は、生の生成速度を上げることと同じくらい、繰り返し作業を避けることに依存します。NVFP4、FP8 KVキャッシュ、状態再利用、木ベースのデコードの組み合わせは、ツールを使う長い会話によって生じる特定のコストに対処しています。

6.4倍という数字は、報告されたMLPerf設定の中では説得力がありますが、より広い結論はもう少し慎重です。AIビルダーにとって重要なのは、これらの最適化が異なるモデル、ツール、電力上限、そして現実世界の精度要件を超えて機能し続けるかどうかです。もしそうなら、ローカルなエージェント展開は、孤立したデモから、より信頼できる本番アーキテクチャへと移行できるでしょう。

広告