NVIDIA sagt, TensorRT Edge-LLM habe Qwen3.6-27B auf Jetson AGX Thor 6,4-mal schneller ausgeführt und damit Cache- und Quantisierungsgewinne für Edge-Agenten hervorgehoben.

NVIDIA sagt, seine TensorRT Edge-LLM-Laufzeit habe den MLPerf Inference v6.1 Edge Agentic Benchmark in 24 Minuten und 36 Sekunden auf einem einzelnen Jetson AGX Thor Developer Kit abgeschlossen. Das sei laut dem Entwicklerblog von NVIDIA 6,4-mal schneller gewesen als der veröffentlichte llama.cpp-Referenzlauf des Benchmarks auf derselben Plattform.
Das Ergebnis ist bedeutsam, weil der Test mehr als nur die Geschwindigkeit einer einmaligen Antwort misst. Er spielt Gespräche eines Software-Engineering-Agenten nach, in denen ein Modell Tool-Aufrufe erzeugt, Ergebnisse empfängt und mit immer längeren Kontexten weiterarbeitet. Der NVIDIA-Beitrag führte Qwen3.6-27B mit 52,33 Tokens pro Sekunde aus und schloss alle 1.007 generierten Turns in der Leistungs-Workload ab.
Die Angaben sind vom Anbieter berichtete Ergebnisse aus NVIDIAs eigener Einreichung und sollten nicht als unabhängiger Vergleich aller Edge-Inference-Stacks verstanden werden. Dennoch zeigen sie, wie Laufzeitoptimierungen die Wirtschaftlichkeit verändern können, mehrstufige KI-Agenten auf lokaler Hardware laufen zu lassen, statt jede Interaktion an ein Cloud-Rechenzentrum zu senden.
Der MLPerf Edge Agentic Benchmark bewertet einen OpenAI-kompatiblen Modell-Endpunkt in einer Leistungs- und einer Genauigkeitsphase. Die Leistungs-Workload enthält 20 aufgezeichnete Gespräche und 1.007 generierte Turns. Während der Agent Tool-Ergebnisse erhält und weiter schlussfolgert, wächst der Kontext auf etwa 23.500 Tokens an.
Diese Struktur erzeugt einen anderen Engpass als ein herkömmlicher Chatbot-Test. Ein Agent verarbeitet wiederholt einen großen Teil desselben Gesprächs und muss gleichzeitig gültige Funktionsaufrufe schnell erzeugen. Das erneute Berechnen der gesamten Historie bei jedem Turn kann längere Trajektorien zunehmend teuer machen, insbesondere auf einem Gerät mit begrenzter Speicherbandbreite und Leistung.
Die Genauigkeitsphase verwendet Prompts aus dem Berkeley Function Calling Leaderboard, kurz BFCL, mit Ein-Turn-Anfragen und deaktiviertem Reasoning. Dabei wird geprüft, ob das Modell die passende Funktion auswählt, gültige Argumente liefert oder korrekt darauf verzichtet, ein Tool aufzurufen. NVIDIA sagt, seine Einreichung sei im SingleStream-Modus auf einem Jetson AGX Thor Developer Kit mit 128 GB Unified Memory im MAXN-Leistungsmodus der Plattform gelaufen.
NVIDIA schreibt das Ergebnis mehreren Optimierungen in TensorRT Edge-LLM zu und nicht nur einem einzelnen Hardwaremerkmal. Das eingereichte Modell Qwen3.6-27B verwendete NVFP4 für Gewichte und Aktivierungen, einschließlich des Language-Model-Heads, sowie FP8 für seinen Key-Value-Cache, kurz KV-Cache.
NVFP4 ist ein vierbittiges Gleitkommaformat, das von der Blackwell-GPU im Jetson AGX Thor unterstützt wird. Niedrigere Präzision reduziert die Datenmenge, die Kernel durch den Speicher bewegen müssen, ein wichtiger Faktor beim Decoding mit kleinen Batches, das NVIDIA als auf Edge-Plattformen stark durch DRAM-Bandbreite begrenzt beschreibt. Die kleinere Darstellung lässt außerdem mehr des Unified Memory des Geräts für Kontext, spekulatives Decoding-Statusmaterial und andere Anwendungstasks frei.
Die Laufzeit nutzte außerdem zwischengespeicherten Gesprächszustand zwischen Turns erneut. NVIDIA sagt, dass über die gesamte Agent-Trajektorie etwa 96 % der Prompt-Tokens aus dem Hot Cache bedient wurden. Statt alle 13,6 Millionen Prompt-Tokens, die während des Benchmarks auftraten, vollständig vorab zu befüllen, befüllte das System nur etwa 0,5 Millionen Tokens neuer Gesprächssuffixe vor.
Diese Optimierung ist besonders für Agent-Workloads relevant. Jeder neue Turn enthält den Großteil des bisherigen Gesprächs sowie ein Tool-Ergebnis oder eine Modellantwort. TensorRT Edge-LLM identifiziert wiederverwendbare Prompt-Präfixe und stellt gecachte Attention-Seiten wieder her. Da Qwen3.6 eine hybride Modellarchitektur verwendet, sagt NVIDIA, dass die Laufzeit außerdem rekurrenten Zustand und partiellen KV-Page-Zustand wiederherstellt, die für die korrekte Fortsetzung der Ausführung benötigt werden.
Für die Tokenerzeugung setzte NVIDIA auf baumbasierte Multi-Token-Prognose. Die Konfiguration verwendete einen achtstufigen Verifikationsbaum mit Top-Two und 16 Knoten und lieferte laut dem Unternehmen eine ungefähr 40-prozentige Verbesserung beim Decoding gegenüber linearer Multi-Token-Prognose für die Funktion-Aufruf-Workload.
Der zentrale Vergleich ist zwischen NVIDIAs TensorRT Edge-LLM-Einreichung und dem über das MLCommons Edge Agentic-Beispiel veröffentlichten llama.cpp-Referenzlauf. Beide Läufe nutzten Qwen3.6-27B auf Jetson AGX Thor, aber die Referenz verwendete Q4_K_M-Quantisierung, während NVIDIAs Einreichung NVFP4 und zusätzliche Laufzeittechniken einsetzte.
NVIDIA berichtet, dass der llama.cpp-Lauf zwei Stunden und 37 Minuten benötigte, um dieselbe Workload abzuschließen. Das TensorRT Edge-LLM-Ergebnis dauerte 24 Minuten und 36 Sekunden. Der Unterschied spiegelt daher den gesamten Software-Stack, die Quantisierungsentscheidungen, das Cache-Management und die Decoding-Strategie wider – nicht einfach eine direkte Messung eines Modellformats gegen ein anderes.
Der Benchmark belegt auch nicht, dass das System in allen Agentenanwendungen 6,4-mal schneller sein wird. Ergebnisse können je nach Modellarchitektur, Kontextlänge, Mustern von Tool-Aufrufen, Quantisierungsqualität, Leistungs-Einstellungen und dem Umfang paralleler Arbeit variieren. NVIDIAs etwa 40-prozentiger Gewinn bei der Multi-Token-Prognose ist ebenfalls eine workloadspezifische Aussage, die an die berichtete Funktion-Aufruf-Konfiguration gebunden ist.
Die verfügbaren Belege sind am stärksten bei Abschlusszeit und Tokens pro Sekunde in diesem definierten Benchmark. Dünner sind sie bei Produktionszuverlässigkeit, Energieverbrauch, thermischem Verhalten über längere Einsätze und Genauigkeitseinbußen unter breiteren Agentenaufgaben. NVIDIA sagt, Entwickler könnten den Branch TensorRT Edge-LLM release/0.9.1-mlpinf einsehen, seinen kalibrierten Qwen3.6-27B-NVFP4-Checkpoint verwenden und das MLCommons-Beispiel für Konfigurationsdetails prüfen, doch diese Materialien stellen für sich genommen keinen unabhängigen Nachweis einer Einführung dar.
Für Entwickler, die KI-Agenten in Fahrzeuge, Roboter, Industrieanlagen oder andere eingebettete Systeme integrieren, weist das Ergebnis auf eine praktische Bereitstellungsfrage hin: Wie viel vom wiederholten Kontext eines Agenten kann lokal gehalten und erneut verwendet werden? Cache-Wiederverwendung kann Vorabfüllungsarbeit reduzieren, ohne den Gesprächsfluss der Anwendung zu verändern, während Multi-Token-Prognose die Generierungsphase nach Tool-Antworten adressiert.
Die Speichereinsparungen können ebenso wichtig sein wie die Rohgeschwindigkeit. Ein Modell mit 27 Milliarden Parametern in einem Niedrigpräzisionsformat braucht immer noch Platz für lange Kontexte, Laufzeitzustand und Anwendungslogik. NVIDIAs Einsatz von 128 GB Unified Memory deutet darauf hin, dass Edge-Bereitstellungen zunehmend um den kombinierten Footprint von Modell und Agent herum entworfen werden könnten – nicht nur um das Modell allein.
Für Unternehmenskunden bietet der Benchmark ein Signal, dass lokale Agenten-Inferenz für Workflows mit Latenz-, Konnektivitäts- oder Datenkontrollanforderungen praktikabler wird. Er ersetzt jedoch nicht die Notwendigkeit, Stromverbrauch, Modellgenauigkeit, Zuverlässigkeit von Tool-Aufrufen, Update-Prozesse und Sicherheitskontrollen im Zielumfeld zu bewerten. Ein schnellerer Benchmark-Lauf ist nur dann nützlich, wenn der Agent richtige Entscheidungen treffen und unter realen Hardwarebedingungen konsistent arbeiten kann.
Das Ergebnis erhöht auch den Wettbewerbsdruck auf alternative Laufzeiten. Der Vorteil von TensorRT Edge-LLM hier beruht auf enger Abstimmung zwischen NVIDIAs Software und Blackwell-Hardware. Entwickler, die andere Beschleuniger verwenden, brauchen vergleichbare Unterstützung für Niedrigpräzisions-Kernel, persistenten Kontextzustand und spekulatives oder baumbasiertes Decoding, wenn sie auf langen Agententrajektorien ähnliche Leistung erreichen wollen.
Die nächsten nützlichen Signale werden unabhängige Reproduktionen des MLPerf-Ergebnisses sein, insbesondere Vergleiche, die neben der Abschlusszeit auch Energieverbrauch, thermische Grenzen und Genauigkeit berichten. Wichtig wird auch sein zu sehen, ob die Cache-Wiederverwendung bei Workloads mit weniger repetitivem Kontext oder variableren Tool-Ausgaben wirksam bleibt.
Entwickler sollten den TensorRT-Edge-LLM-Release-Branch und das MLCommons-Edge-Agentic-Beispiel auf aktualisierte Modellunterstützung, Build-Anweisungen und zusätzliche Hardware-Einreichungen beobachten. Breitere Tests von Qwen3.6-27B NVFP4 werden helfen zu klären, ob die berichtete Leistung für Produktionsagenten praktisch ist oder auf die aufgezeichneten Trajektorien des Benchmarks beschränkt bleibt.
Schließlich würden Daten aus eingesetzten Fahrzeugen, Robotern und Industriesystemen einen stärkeren Test des Ansatzes liefern. Diese Umgebungen bringen intermittierende Konnektivität, enge Leistungsbudgets, Sensoreingaben, Sicherheitsanforderungen und Software-Updates mit sich, die der aktuelle Benchmark nicht vollständig erfasst.
NVIDIAs Ergebnis ist am besten als Systemdemonstration zu verstehen: Die Leistung von Edge-Agenten hängt ebenso stark davon ab, wiederholte Arbeit zu vermeiden, wie davon, die rohe Generierungsgeschwindigkeit zu erhöhen. Die Kombination aus NVFP4, FP8-KV-Cache, Zustandserhaltung und baumbasierter Decodierung adressiert die spezifischen Kosten, die durch lange, werkzeugnutzende Gespräche entstehen.
Die 6,4x-Zahl ist innerhalb des berichteten MLPerf-Setups überzeugend, aber die breitere Schlussfolgerung ist zurückhaltender. Für KI-Entwickler ist die wichtige Frage, ob diese Optimierungen unterschiedliche Modelle, Tools, Leistungsbudgets und reale Genauigkeitsanforderungen überstehen. Wenn ja, könnten lokale Agentenbereitstellungen von isolierten Demonstrationen hin zu glaubwürdigeren Produktionsarchitekturen übergehen.