TensorRT Edge-LLM 在 Jetson AGX Thor 上以快 6.4 倍完成 MLPerf Edge Agentic 基準測試
NVIDIA 表示,TensorRT Edge-LLM 在 Jetson AGX Thor 上讓 Qwen3.6-27B 的執行速度快了 6.4 倍,凸顯了邊緣代理在快取與量化上的效益。
LLM效率 的最新新聞與分析
NVIDIA 表示,TensorRT Edge-LLM 在 Jetson AGX Thor 上讓 Qwen3.6-27B 的執行速度快了 6.4 倍,凸顯了邊緣代理在快取與量化上的效益。
Google Research 已公開發布 TurboQuant,一套免訓練的 AI 記憶體壓縮演算法套件,可將 KV 快取記憶體使用量減少 6 倍,並將注意力運算加速 8 倍,可能使企業 AI 推論成本降低超過 50%。