NVIDIA 表示,TensorRT Edge-LLM 在 Jetson AGX Thor 上讓 Qwen3.6-27B 的執行速度快了 6.4 倍,凸顯了邊緣代理在快取與量化上的效益。

NVIDIA 表示,其 TensorRT Edge-LLM 執行階段在單一 Jetson AGX Thor Developer Kit 上,於 24 分 36 秒內完成了 MLPerf Inference v6.1 Edge Agentic 基準測試。根據 NVIDIA 的開發者部落格,這比同一平台上公布的 llama.cpp 參考執行快了 6.4 倍。
這個結果之所以重要,是因為該測試衡量的不只是單次回應速度。它重播了軟體工程代理的對話,模型會生成工具呼叫、接收結果,並在越來越長的上下文中持續推理。NVIDIA 的提交以每秒 52.33 個 token 執行 Qwen3.6-27B,並完成了效能工作負載中的全部 1,007 個生成回合。
這些數字是 NVIDIA 自家提交的供應商回報結果,不應被視為對所有邊緣推論堆疊的獨立比較。然而,它們仍顯示出執行階段層級的最佳化,如何改變在本地硬體上運行多步驟 AI 代理 的經濟性,而不是將每次互動都送往雲端資料中心。
MLPerf Edge Agentic 基準測試會在效能與準確度兩個階段評估一個相容 OpenAI 的模型端點。其效能工作負載包含 20 段已記錄對話與 1,007 個生成回合。當每個代理接收工具結果並持續推理時,context 會增長到約 23,500 個 token。
這種結構與傳統聊天機器人測試形成不同的瓶頸。代理會反覆處理同一段對話的大部分內容,同時又必須快速產生有效的函式呼叫。每一回合都重新計算整段歷史,會使長時間軌跡的成本愈來愈高,特別是在記憶體頻寬與功耗受限的裝置上。
準確度階段使用 Berkeley Function Calling Leaderboard,或 BFCL 的提示,採單回合請求並關閉推理。它會檢查模型是否選擇適當的函式、提供有效參數,或正確拒絕呼叫工具。NVIDIA 表示,其提交是在平台 MAXN 功耗模式下、配備 128 GB 統一記憶體的單一 Jetson AGX Thor Developer Kit 上,以 SingleStream 模式執行。
NVIDIA 將結果歸因於 TensorRT Edge-LLM 中的多項最佳化,而不是單一硬體特性。提交的 Qwen3.6-27B 模型在權重與激活值上使用 NVFP4,包括語言模型 head,並以 FP8 作為其 key-value cache,也就是 KV cache。
NVFP4 是 Jetson AGX Thor 上 Blackwell GPU 支援的四位元浮點格式。較低精度表示可減少核心在記憶體中傳輸的資料量,這對小批次解碼尤其重要;NVIDIA 認為在邊緣平台上,這種解碼高度受 DRAM 頻寬限制。更小的表示形式也讓裝置的統一記憶體能保留更多空間給 context、推測式解碼狀態及其他應用任務。
執行階段也在回合之間重複使用快取的對話狀態。NVIDIA 表示,在整個代理軌跡中,約 96% 的提示 token 都是從熱快取中提供的。系統並未對基準測試中遇到的全部 1,360 萬個提示 token 進行預填,而只對約 50 萬個新的對話後綴 token 進行預填。
這項最佳化對代理工作負載尤其重要。每個新回合都包含前面大部分對話,以及一個工具結果或模型回應。TensorRT Edge-LLM 會辨識可重用的提示前綴,並還原快取的 attention page。由於 Qwen3.6 採用混合式模型架構,NVIDIA 表示執行階段也會還原持續執行所需的 recurrent state 與部分 KV page state。
在 token 生成方面,NVIDIA 採用了基於樹的多 token 預測。該配置使用八步驟、top-two、16 節點的驗證樹,並據公司稱,針對函式呼叫工作負載,相較於線性多 token 預測帶來約 40% 的解碼改善。
核心比較是 NVIDIA 的 TensorRT Edge-LLM 提交,與透過 MLCommons Edge Agentic 範例公布的 llama.cpp 參考執行之間的對照。兩者都在 Jetson AGX Thor 上使用 Qwen3.6-27B,但參考執行採用 Q4_K_M 量化,而 NVIDIA 的提交則使用 NVFP4 與額外的執行階段技術。
NVIDIA 報告指出,llama.cpp 執行同一工作負載花了 2 小時 37 分鐘。TensorRT Edge-LLM 的結果則花了 24 分 36 秒。因此,這個差異反映的是整體軟體堆疊、量化選擇、快取處理與解碼策略,而不只是單純比較一種模型格式與另一種模型格式。
這項基準測試也不能證明該系統在所有代理應用中都會快 6.4 倍。結果會因模型架構、context 長度、工具呼叫模式、量化品質、功耗設定,以及平行工作量而有所不同。NVIDIA 約 40% 的多 token 預測增益,同樣也是與所報告函式呼叫配置相綁定的工作負載特定主張。
目前可得的證據,在這個定義明確的基準測試中,對完成時間與每秒 token 數最具說服力。至於生產環境可靠性、能源使用、長時間部署下的熱行為,以及更廣泛代理任務中的準確度取捨,證據則較為薄弱。NVIDIA 表示,開發者可查看 TensorRT Edge-LLM 的 release/0.9.1-mlpinf 分支、使用其校準過的 Qwen3.6-27B NVFP4 checkpoint,並參考 MLCommons 範例了解設定細節,但這些材料本身並不構成獨立的採用證據。
對於將 AI 代理整合進車輛、機器人、工業設備或其他嵌入式系統的開發者來說,這個結果提出了一個實際部署問題:代理的重複 context 有多少可以保留在本地並重用?快取重用可以減少預填工作量,而不改變應用的對話流程;多 token 預測則針對工具回應之後的生成階段。
記憶體節省可能和原始速度一樣重要。即使以低精度格式執行,270 億參數模型仍需要空間來容納長 context、執行階段狀態與應用邏輯。NVIDIA 使用 128 GB 統一記憶體,暗示邊緣部署可能愈來愈圍繞模型與代理的綜合足跡來設計,而不只是模型本身。
對企業買家而言,這項基準測試顯示,在延遲、連線性或資料控制很重要的工作流程中,本地代理推論正變得更可行。但這並不代表無需再評估目標環境中的耗電、模型準確度、工具呼叫可靠性、更新流程與安全控制。更快的基準測試只有在代理能做出正確決策,並在真實硬體限制下穩定運作時才有價值。
這個結果也對替代執行階段帶來競爭壓力。TensorRT Edge-LLM 的優勢來自 NVIDIA 軟體與 Blackwell 硬體之間的緊密協作。若要在長代理軌跡上取得類似效能,使用其他加速器的開發者就需要對低精度 kernel、持久化 context state,以及推測式或基於樹的解碼提供相當的支援。
下一個有價值的訊號,將是對 MLPerf 結果的獨立重現,尤其是同時報告完成時間、能源消耗、熱限制與準確度的比較。也需要觀察在 context 較不重複或工具輸出更多樣的工作負載中,快取重用是否仍然有效。
開發者應關注 TensorRT Edge-LLM 的 release 分支與 MLCommons Edge Agentic 範例,以取得更新的模型支援、建置指引與更多硬體提交。更廣泛的 Qwen3.6-27B NVFP4 測試,將有助於釐清所報告的效能是否足以用於 production 代理,而不僅限於基準測試的記錄軌跡。
最後,來自已部署車輛、機器人與工業系統的證據,將為這種方法提供更強的驗證。這些環境包含間歇性連線、嚴格的功耗預算、感測器輸入、安全需求與軟體更新,而現行基準測試並未完全涵蓋。
NVIDIA 的結果最適合被理解為一項系統示範:邊緣代理的效能,不只取決於提升原始生成速度,也取決於避免重複工作。NVFP4、FP8 KV cache、狀態重用與基於樹的解碼組合,正是針對長時間、使用工具的對話所產生的特定成本。
在所報告的 MLPerf 設定中,6.4 倍的數字相當有說服力,但更廣泛的結論則較為保守。對 AI 建構者而言,重要的問題是這些最佳化能否在不同模型、工具、功耗範圍與真實世界準確度需求下依然成立。如果可以,本地代理部署就有機會從孤立的示範,走向更具可信度的生產架構。