TensorRT Edge-LLM, Jetson AGX Thor에서 MLPerf Edge Agentic 벤치마크를 6.4배 더 빠르게 완료
NVIDIA는 TensorRT Edge-LLM이 Jetson AGX Thor에서 Qwen3.6-27B를 6.4배 더 빠르게 실행했으며, 엣지 에이전트를 위한 캐시와 양자화 이점을 강조했다고 밝혔습니다.
LLM 효율성에 대한 최신 뉴스 및 분석
NVIDIA는 TensorRT Edge-LLM이 Jetson AGX Thor에서 Qwen3.6-27B를 6.4배 더 빠르게 실행했으며, 엣지 에이전트를 위한 캐시와 양자화 이점을 강조했다고 밝혔습니다.
Google Research가 훈련이 필요 없는 AI 메모리 압축 알고리즘 제품군 TurboQuant를 공개했습니다. KV 캐시 메모리 사용량을 6배 줄이고 어텐션 연산을 8배 가속화해 기업의 AI 추론 비용을 50% 이상 절감할 가능성이 있습니다.