AWS 將 G7 Blackwell GPU 與 G5、G6 比較,用於小型 LLM 推論

AWS 在 SageMaker AI 上針對 G5、G6、G6e 與 G7 進行 30B MoE 模型基準測試,顯示 Blackwell 可能如何改善推論成本與延遲。

AI News

Amazon Web Services 正使用兩個 300 億參數的 Mixture-of-Experts 模型,比較 Amazon SageMaker AI 上用於正式推論的不同 GPU 世代。該公司的基準測試檢視 G5、G6、G6e 與新的 G7 組態在吞吐量、延遲與每 token 成本上的表現,AWS 表示,採用 NVIDIA Blackwell 的 G7 執行個體可為特定工作負載帶來更好的價格效能。

這項基準測試之所以重要,是因為模型大小本身並不能決定服務經濟性。量化、記憶體頻寬、專家路由與服務軟體堆疊,都可能改變哪一種執行個體才是最實際的選擇。因此,AWS 在其 Machine Learning Blog 發表的結果,最好被視為部署研究,而不是 GPU 家族的普遍排名。

兩個模型,兩條評估路徑

AWS 針對程式設計用途測試了 Qwen3-Coder-30B-A3B-Instruct-FP8,涵蓋程式碼生成、除錯、重構與開發者副駕等情境。這項實驗比較了使用 NVIDIA A10G GPU 的 ml.g5.12xlarge 執行個體、使用 NVIDIA L4 GPU 的 ml.g6.12xlarge 執行個體,以及使用 RTX PRO 4500 Blackwell GPU 的 ml.g7.12xlarge 執行個體。測試使用 SageMaker AI DJL Large Model Inference 容器。

該公司的第二個情境使用 NVIDIA Nemotron-3-Nano-30B-A3B-NVFP4,處理推理、問答、摘要與 agentic 工作負載。AWS 並非只部署固定端點,而是使用搭配 vLLM 的 SageMaker AI Generative AI Inference Recommendations 來評估 G6、G6e 與 G7 選項,並根據所選的最佳化目標找出配置。

這個區別很重要。Qwen3-Coder-30B 測試代表在預期程式設計工作負載下,對已部署端點進行直接比較。Nemotron-3-Nano-30B 的實驗則代表自動化推薦流程,SageMaker AI 會評估候選配置,並依成本、延遲與吞吐量等指標進行排序。

為什麼 G7 可能改變比較結果

這些配置並不具備相同的 GPU 記憶體容量。以 Qwen3-Coder-30B 的比較而言,G5 與 G6 執行個體各使用四張 GPU、合計 96 GB GPU 記憶體,而 G7 組態使用兩張 GPU、64 GB。AWS 將這種不平衡視為測試的一部分:雖然新一代執行個體擁有較少加速器與較少總記憶體,仍然被拿來評估。

第二個比較同樣不均衡。G6 設定有四張 L4 GPU 與 96 GB 合計記憶體,G6e 有四張 L40S GPU 與 192 GB,而 G7 則有兩張 GPU 與 64 GB。這使得這項實驗更像正式生產選型問題,而不是單純的世代對世代基準測試。即使某個配置在價格效能上勝出,若模型、權重或執行狀態無法裝入可用記憶體,仍可能不適合。

AWS 指出 G7 可能具備優勢的兩項硬體特性。首先,G7 使用 NVIDIA Blackwell GPU,原生支援包括 NVFP4 在內的低精度格式。其次,該架構提供旨在改善 token 生成的記憶體與運算能力。AWS 表示,其他受測世代也能執行 NVFP4 權重,但沒有相同的硬體加速。

對 MoE 模型而言,AWS 認為在解碼階段記憶體頻寬尤其重要,因為每個 token 只會啟用部分 experts。這可能使資料搬移與 token 間延遲,比模型表面上的參數數量更為關鍵。實際結果取決於工作負載:受益於低精度加速的模型,與受限於記憶體容量或特定服務框架的模型,可能會偏好不同的執行個體。

證據與主張的限制

目前可得的證據來自 AWS 自身的技術文章與操作說明。AWS 表示,G7 測試顯示吞吐量、延遲與每 token 成本都有可量測的改善,並將 G7 描述為受測案例中潛在的價格效能領導者。這些是供應商自行報告的結果,不是獨立評估,也不是跨多家雲端供應商的基準測試。

提供的來源材料並未包含底層數值結果、測試時長、請求分佈、併發層級、區域價格或詳細的每 token 成本表。因此,無法判定收益有多大、是否穩定出現,或相同結果是否也適用於其他模型與流量模式。

結果也受所選軟體影響。Qwen3-Coder-30B 是透過 DJL Large Model Inference 容器進行評估,而 Nemotron-3-Nano-30B 工作流程使用 vLLM 與 SageMaker AI 的推薦工具。批次處理、排程、量化、上下文長度或請求併發的變更,都可能改變結果。買家應先用自己的 prompts 與服務水準目標重現測試,再把 AWS 的推薦當成生產決策。

AWS 表示,推薦功能會在真實 GPU 基礎架構上執行候選配置,並根據量測到的效能回傳經過驗證、可直接部署的建議。即便如此,這裡的「經過驗證」指的是服務的基準測試流程,而不是對模型品質、安全性或商業適用性的獨立認證。

這項基準測試對 AI 團隊的意義

對建構者而言,最直接的啟示是應該對完整的服務配置做基準測試,而不是只根據 GPU 規格表挑選硬體。部署程式碼助理的團隊,應測量首 token 時間、token 間延遲、持續吞吐量,以及在真實併發下的成本。建立 agentic 應用的團隊,可能需要將短提示詞與突發流量,和批次摘要服務採用不同權重考量。

SageMaker AI 的推薦工作流程,可能減少測試多種執行個體家族的人工工作,尤其是已在 AWS 上管理端點的團隊。不過,它並不能消除準確定義工作負載的必要。錯誤的流量輪廓或最佳化目標,可能產生技術上有效、但與生產不相符的推薦。

記憶體仍然是部署限制。範例中 G7 的合計記憶體較少,可能讓它對能有效以 FP8 或 NVFP4 收納的模型很有吸引力,但對需要更大上下文視窗、龐大 key-value cache 或額外模型元件的部署則不那麼合適。當容量比純粹的 token 經濟更重要時,G6e 更大的記憶體佔用仍可能更受青睞。

對企業買家而言,這項比較也凸顯可攜性風險。NVIDIA Blackwell 加速的價值,取決於支援格式、模型實作與執行期成熟度。標準化某個模型的團隊,應確認自己偏好的量化路徑與推論引擎是否確實有效利用硬體,而不是假設新一代 GPU 會自動降低總服務成本。

接下來該觀察什麼

最有幫助的是 AWS 公布完整基準表,包括每個配置的吞吐量、首 token 時間、token 間延遲、併發、區域價格與每 token 成本。這些數字可以顯示 G7 的優勢是廣泛存在,還是集中在特定工作負載形態。

團隊也應關注 G7 的可用性。AWS 指出,在所描述的設定中,G7 一般可在 US East (Ohio) 與 US West (Oregon) 使用,因此區域容量與資料駐留需求也成為採購決策的一部分。

後續比較還應測試更長上下文、不同 batch size、額外量化格式,以及兩個被選中的 30B MoE 範例之外的模型。跨雲的獨立重現,將提供更有力的基礎來評估 Blackwell 的優勢是否能在不同定價與軟體環境下維持。

Creati.ai 觀點

AWS 並不是在宣布一個新模型,也不是要普遍取代 G5 和 G6。它提出的是一個較窄但重要的基礎設施論點:當模型與執行期能展現合適的低精度與記憶體頻寬優勢時,新一代加速器可以改變小型與中型 LLM 服務的經濟性。

對 AI 團隊而言,最強烈的訊號是朝向針對工作負載的自動化執行個體選擇。但由於已公開的證據受 AWS 控制,而且提供材料中缺少數值基準細節,買家應把 G7 報告中的收益視為起始假設。生產環境中的勝出者,將取決於模型契合度、延遲目標、流量形態、區域可用性,以及營運整個推論堆疊的成本。

廣告