TensorRT Edge-LLM、Jetson AGX Thor上でMLPerf Edge Agenticベンチマークを6.4倍高速で完了
NVIDIAは、TensorRT Edge-LLMがJetson AGX Thor上でQwen3.6-27Bを6.4倍高速で実行し、エッジエージェント向けのキャッシュと量子化の効果を示したと述べています。
LLM効率に関する最新ニュースと分析
NVIDIAは、TensorRT Edge-LLMがJetson AGX Thor上でQwen3.6-27Bを6.4倍高速で実行し、エッジエージェント向けのキャッシュと量子化の効果を示したと述べています。
Google Researchは、トレーニング不要のAIメモリ圧縮アルゴリズムスイート「TurboQuant」を公開しました。KVキャッシュのメモリ使用量を6倍削減し、アテンション計算を8倍高速化することで、企業のAI推論コストを50%以上削減する可能性があります。