AWSが小規模LLM推論向けにG7 Blackwell GPUをG5とG6と比較

AWSはSageMaker AI上でG5、G6、G6e、G7にまたがって30B MoEモデルをベンチマークし、Blackwellが推論コストとレイテンシをどう改善しうるかを示している。

AI News

Amazon Web Servicesは、Amazon SageMaker AIでの本番推論におけるGPU世代比較のために、2つの300億パラメータのMixture-of-Expertsモデルを使用している。同社のベンチマークは、スループット、レイテンシ、トークンあたりコストの観点からG5、G6、G6e、そして新しいG7構成を検証しており、AWSはNVIDIA Blackwell搭載のG7インスタンスが一部のワークロードでより良い価格性能を提供できると報告している。

このベンチマークが重要なのは、モデルサイズだけではサービングの経済性は決まらないからだ。量子化、メモリ帯域、エキスパートルーティング、そしてサービング用ソフトウェアスタックのすべてが、どのインスタンスが最も実用的かを左右しうる。したがって、AWSのMachine Learning Blogで公開された結果は、GPUファミリーの普遍的な順位付けというより、デプロイメント研究として読むのが適切だ。

2つのモデル、2つの評価経路

AWSは、コード生成、デバッグ、リファクタリング、開発者向けコパイロットを含むコーディング用途向けにQwen3-Coder-30B-A3B-Instruct-FP8をテストした。この実験では、NVIDIA A10G GPUを搭載したml.g5.12xlargeインスタンス、NVIDIA L4 GPUを搭載したml.g6.12xlargeインスタンス、RTX PRO 4500 Blackwell GPUを搭載したml.g7.12xlargeインスタンスを比較している。このテストではSageMaker AI DJL Large Model Inferenceコンテナを使用する。

同社の第2のシナリオでは、推論、質問応答、要約、エージェント型ワークロード向けにNVIDIA Nemotron-3-Nano-30B-A3B-NVFP4を使用する。固定エンドポイントを単にデプロイするのではなく、AWSはSageMaker AI Generative AI Inference RecommendationsとvLLMを使ってG6、G6e、G7の選択肢を評価し、選択した最適化目標に基づいて構成を特定する。

この違いは重要だ。Qwen3-Coder-30Bのテストは、想定されるコーディングワークロード下でのデプロイ済みエンドポイントの直接比較を表している。一方、Nemotron-3-Nano-30Bの試行は、自動化された推薦プロセスであり、SageMaker AIが候補構成を評価し、コスト、レイテンシ、スループットなどの指標に基づいて順位付けする。

なぜG7が比較を変えうるのか

構成ごとのGPUメモリ量は同等ではない。Qwen3-Coder-30Bの比較では、G5とG6の各インスタンスは4基のGPUで合計96GBのGPUメモリを持つ一方、G7構成は2基のGPUで64GBを使用する。AWSはこの不均衡をテストの一部として示しており、新しいインスタンスはアクセラレータ数も総メモリ量も少ないにもかかわらず評価されている。

2つ目の比較も同様に不均衡だ。G6の構成は4基のL4 GPUと96GBの合計メモリ、G6eは4基のL40S GPUと192GB、G7は2基のGPUと64GBを持つ。これにより、この検証は単純な世代間ベンチマークというより、本番向けの選定問題に近いものになっている。価格性能で勝つ構成であっても、モデル、重み、またはランタイム状態が利用可能なメモリに収まらなければ不適切である可能性がある。

AWSは、G7の潜在的な優位性の背景にある2つのハードウェア特性を挙げている。第1に、G7はNVIDIA Blackwell GPUを使用しており、NVFP4を含む低精度フォーマットをネイティブにサポートする。第2に、このアーキテクチャはトークン生成を改善することを目的としたメモリおよび計算能力を備えている。AWSによれば、他のテスト対象世代でもNVFP4重みは実行可能だが、同じハードウェアアクセラレーションはない。

MoEモデルでは、各トークンが一部のエキスパートだけを活性化するため、AWSはデコード中にメモリ帯域が特に重要になると主張している。これにより、データ移動やトークン間レイテンシが、モデルの見かけ上のパラメータ数よりも重要になる場合がある。実際の結果はワークロードに依存する。低精度アクセラレーションの恩恵を受けるモデルは、メモリ容量や特定のサービングフレームワークに制約されるモデルとは異なるインスタンス選好を示す可能性がある。

主張の根拠と限界

利用可能な証拠は、AWS自身の技術記事とウォークスルーに基づいている。AWSは、G7のテストでスループット、レイテンシ、トークンあたりコストに測定可能な改善が見られ、G7をテスト対象ユースケースにおける価格性能リーダー候補と説明している。これらはベンダー報告の結果であり、独立した評価でも、複数のクラウド事業者を横断するベンチマークでもない。

提供されたソース資料には、元となる数値結果、テスト期間、リクエスト分布、同時実行レベル、地域別価格、詳細なトークンあたりコスト表が含まれていない。したがって、どれほど大きな改善か、どの程度一貫して現れるか、他のモデルやトラフィックパターンにも同じ結果が当てはまるかは判断できない。

結果は選択されたソフトウェアにも左右される。Qwen3-Coder-30BはDJL Large Model Inferenceコンテナ経由で評価され、Nemotron-3-Nano-30BのワークフローではvLLMとSageMaker AIの推薦ツールが使われる。バッチング、スケジューリング、量子化、コンテキスト長、リクエスト同時実行数の変更は結果を変えうる。AWSの推薦を本番判断とみなす前に、購入者は自分たちのプロンプトとSLA目標で再現すべきだ。

AWSは、推薦機能が実際のGPUインフラ上で候補構成を実行し、測定された性能に基づいて検証済みのデプロイ可能な提案を返すと述べている。ただし、この文脈での「検証済み」は、モデルの品質、安全性、ビジネス適合性の独立認証を指すのではなく、サービスのベンチマークワークフローを指す。

このベンチマークがAIチームに意味すること

ビルダーにとっての直接的な教訓は、GPU仕様書だけでハードウェアを選ぶのではなく、サービング構成全体をベンチマークすることだ。コーディングアシスタントを展開するチームは、最初のトークンまでの時間、トークン間レイテンシ、持続的スループット、現実的な同時実行下でのコストを測定すべきである。エージェント型アプリケーションを構築するチームは、短いプロンプトやバースト的トラフィックを、バッチ要約サービスとは異なる観点で評価する必要があるかもしれない。

SageMaker AIの推薦ワークフローは、特にAWS上で既にエンドポイントを管理しているチームにとって、複数のインスタンスファミリーを試す手作業を減らせる可能性がある。しかし、ワークロードを正確に定義する必要性をなくすものではない。誤ったトラフィックプロファイルや最適化目標は、技術的には有効でも本番に合わない推薦を生む可能性がある。

メモリは依然としてデプロイメント上の制約だ。例ではG7の合計メモリが少ないため、FP8やNVFP4で効率的に収まるモデルには魅力的かもしれないが、より大きなコンテキストウィンドウ、広範なキー・バリューキャッシュ、追加のモデルコンポーネントを必要とするデプロイには向かない可能性がある。容量が純粋なトークン経済性より重要な場合、G6eのより大きなメモリフットプリントの方が依然として望ましいかもしれない。

企業買い手にとって、この比較は移植性リスクも示している。NVIDIA Blackwellの高速化の価値は、対応フォーマット、モデル実装、ランタイムの成熟度に依存する。モデルを標準化するチームは、新しいGPUだから自動的に総サービングコストが下がると想定するのではなく、希望する量子化経路と推論エンジンがハードウェアを効果的に活用できることを確認すべきだ。

次に注目すべき点

最も有用なのは、AWSが各構成について、スループット、最初のトークンまでの時間、トークン間レイテンシ、同時実行数、地域別価格、トークンあたりコストを含む完全なベンチマーク表を公開することだろう。そうした数値があれば、G7の優位性が広範なのか、それとも特定のワークロード形状に集中しているのかが分かる。

チームはG7の提供状況にも注目すべきだ。AWSは、記述された構成ではG7がUS East (Ohio) と US West (Oregon) で一般提供されていると述べており、地域的な容量やデータ居住要件が購入判断の一部になる。

今後の比較では、より長いコンテキスト、異なるバッチサイズ、追加の量子化形式、そして選ばれた2つの30B MoE例以外のモデルも試すべきだ。複数クラウドにわたる独立再現は、Blackwellの優位性が異なる価格設定やソフトウェア環境でも維持されるかを評価するための、より強い根拠を提供するだろう。

Creati.ai の視点

AWSは新しいモデルやG5・G6の普遍的な代替を発表しているわけではない。むしろ、より新しいアクセラレータは、モデルとランタイムが適切な低精度およびメモリ帯域の利点を引き出せる場合、小規模・中規模LLMのサービング経済性を変えうる、というより狭いが重要なインフラ論を示している。

AIチームにとって最も強いシグナルは、ワークロード特化の自動インスタンス選択への移行だ。しかし、公開された証拠はAWS管理下のものであり、提供資料には数値ベンチマークの詳細が欠けているため、購入者は報告されたG7の改善を出発点の仮説として扱うべきだ。実運用での勝者は、モデル適合、レイテンシ目標、トラフィック形状、地域的な可用性、そして推論スタック全体を運用するコストによって決まる。

広告