TensorRT Edge-LLM, Jetson AGX Thor에서 MLPerf Edge Agentic 벤치마크를 6.4배 더 빠르게 완료

NVIDIA는 TensorRT Edge-LLM이 Jetson AGX Thor에서 Qwen3.6-27B를 6.4배 더 빠르게 실행했으며, 엣지 에이전트를 위한 캐시와 양자화 이점을 강조했다고 밝혔습니다.

AI News

NVIDIA는 자사의 TensorRT Edge-LLM 런타임이 단일 Jetson AGX Thor Developer Kit에서 MLPerf Inference v6.1 Edge Agentic 벤치마크를 24분 36초 만에 완료했다고 밝혔습니다. NVIDIA 개발자 블로그에 따르면 이는 같은 플랫폼에서 공개된 llama.cpp 기준 실행보다 6.4배 더 빠른 결과입니다.

이 결과가 중요한 이유는 이 테스트가 단순한 단발성 응답 속도 이상을 측정하기 때문입니다. 모델이 도구 호출을 생성하고 결과를 받은 뒤, 점점 더 긴 컨텍스트를 따라 계속 추론하는 소프트웨어 엔지니어링 에이전트 대화를 재생합니다. NVIDIA의 제출은 Qwen3.6-27B를 초당 52.33 토큰으로 실행했으며 성능 워크로드의 1,007개 생성 턴을 모두 완료했습니다.

이 수치는 NVIDIA의 자체 제출 결과를 바탕으로 한 벤더 보고치이며, 모든 엣지 추론 스택을 독립적으로 비교한 것으로 보아서는 안 됩니다. 그럼에도 불구하고, 런타임 수준의 최적화가 모든 상호작용을 클라우드 데이터센터로 보내는 대신 로컬 하드웨어에서 다단계 AI 에이전트를 실행하는 경제성을 어떻게 바꿀 수 있는지를 보여줍니다.

MLPerf 테스트가 측정한 것

MLPerf Edge Agentic 벤치마크는 OpenAI 호환 모델 엔드포인트를 성능 단계와 정확도 단계에서 평가합니다. 성능 워크로드에는 20개의 기록된 대화와 1,007개의 생성 턴이 포함됩니다. 각 에이전트가 도구 결과를 받고 추론을 계속할수록 컨텍스트는 약 23,500 토큰까지 늘어납니다.

이 구조는 기존 챗봇 테스트와는 다른 병목을 만듭니다. 에이전트는 같은 대화의 상당 부분을 반복해서 처리해야 하며, 동시에 유효한 함수 호출을 빠르게 생성해야 합니다. 매 턴 전체 이력을 다시 계산하면, 특히 메모리 대역폭과 전력이 제한된 장치에서는 긴 경로가 점점 더 비싸질 수 있습니다.

정확도 단계에서는 Berkeley Function Calling Leaderboard, 즉 BFCL의 프롬프트를 사용하며, 단일 턴 요청과 추론 비활성화 상태로 평가합니다. 모델이 적절한 함수를 선택하고, 유효한 인자를 제공하며, 또는 도구 호출을 올바르게 거부하는지 확인합니다. NVIDIA에 따르면 해당 제출은 플랫폼의 MAXN 전력 모드에서 128GB 통합 메모리를 탑재한 Jetson AGX Thor Developer Kit 1대에서 SingleStream 모드로 실행되었습니다.

NVIDIA 결과의 엔지니어링 배경

NVIDIA는 이 결과가 단일 하드웨어 기능이 아니라 TensorRT Edge-LLM의 여러 최적화 덕분이라고 설명합니다. 제출된 Qwen3.6-27B 모델은 언어 모델 헤드를 포함한 가중치와 활성값에 NVFP4를 사용했고, 키-값 캐시, 즉 KV 캐시에는 FP8을 사용했습니다.

NVFP4는 Jetson AGX Thor의 Blackwell GPU가 지원하는 4비트 부동소수점 형식입니다. 낮은 정밀도 표현은 커널이 메모리를 통해 이동해야 하는 데이터 양을 줄여줍니다. 이는 NVIDIA가 엣지 플랫폼에서 DRAM 대역폭에 크게 제약받는다고 설명하는, 작은 배치의 디코딩에서 중요한 요소입니다. 더 작은 표현은 또한 장치의 통합 메모리에서 컨텍스트, 추론적 디코딩 상태, 기타 애플리케이션 작업을 위한 공간을 더 많이 남겨둡니다.

런타임은 또한 턴 사이에 캐시된 대화 상태를 재사용했습니다. NVIDIA는 전체 에이전트 경로 동안 프롬프트 토큰의 약 96%가 핫 캐시에서 제공되었다고 밝혔습니다. 벤치마크 동안 발생한 1,360만 개의 프롬프트 토큰을 모두 사전 채움하는 대신, 시스템은 새로운 대화 접미사의 약 50만 개 토큰만 사전 채움했습니다.

이 최적화는 특히 에이전트 워크로드에서 중요합니다. 각 새 턴에는 이전 대화의 대부분과 도구 결과 또는 모델 응답이 함께 포함됩니다. TensorRT Edge-LLM은 재사용 가능한 프롬프트 접두사를 식별하고 캐시된 어텐션 페이지를 복원합니다. Qwen3.6은 하이브리드 모델 아키텍처를 사용하므로, NVIDIA는 런타임이 올바르게 실행을 이어가기 위해 필요한 순환 상태와 부분적인 KV 페이지 상태도 복원한다고 말합니다.

토큰 생성에는 NVIDIA가 트리 기반 멀티토큰 예측을 사용했습니다. 이 구성은 8단계, 상위 2개, 16노드 검증 트리를 사용했고, 회사에 따르면 함수 호출 워크로드에서 선형 멀티토큰 예측보다 약 40%의 디코딩 개선을 제공했습니다.

근거, 비교, 한계

핵심 비교는 NVIDIA의 TensorRT Edge-LLM 제출과 MLCommons Edge Agentic 예제를 통해 공개된 llama.cpp 기준 실행 사이입니다. 두 실행 모두 Jetson AGX Thor에서 Qwen3.6-27B를 사용했지만, 기준 실행은 Q4_K_M 양자화를 사용했고 NVIDIA의 제출은 NVFP4와 추가 런타임 기법을 사용했습니다.

NVIDIA는 llama.cpp 실행이 같은 워크로드를 완료하는 데 2시간 37분이 걸렸다고 보고합니다. TensorRT Edge-LLM 결과는 24분 36초였습니다. 따라서 이 차이는 단순히 한 모델 형식과 다른 형식의 직접 비교가 아니라, 전체 소프트웨어 스택, 양자화 선택, 캐시 처리, 디코딩 전략을 반영합니다.

또한 이 벤치마크는 모든 에이전트 애플리케이션에서 시스템이 6.4배 더 빨라질 것임을 입증하지 않습니다. 결과는 모델 아키텍처, 컨텍스트 길이, 도구 호출 패턴, 양자화 품질, 전력 설정, 병렬 작업량에 따라 달라질 수 있습니다. NVIDIA의 약 40% 멀티토큰 예측 향상 역시 보고된 함수 호출 구성에 묶인 워크로드 특화 주장입니다.

현재 공개된 증거는 이 정의된 벤치마크에서 완료 시간과 초당 토큰 수에 대해 가장 강합니다. 반면 생산 환경에서의 신뢰성, 에너지 사용, 장시간 배포 시 열 거동, 더 넓은 에이전트 작업에서의 정확도 트레이드오프에 대해서는 상대적으로 약합니다. NVIDIA는 개발자가 TensorRT Edge-LLM release/0.9.1-mlpinf 브랜치를 확인하고, 보정된 Qwen3.6-27B NVFP4 체크포인트를 사용하며, 구성 세부사항은 MLCommons 예제를 참고할 수 있다고 밝혔지만, 이러한 자료만으로는 독립적인 도입 증거가 되지는 않습니다.

이 결과가 엣지 AI 빌더에게 중요한 이유

차량, 로봇, 산업 장비 또는 기타 임베디드 시스템에 AI 에이전트를 구축하는 개발자에게 이 결과는 실질적인 배포 질문을 던집니다. 에이전트의 반복적인 컨텍스트 중 얼마나 많은 부분을 로컬에 유지하고 재사용할 수 있는가 하는 점입니다. 캐시 재사용은 애플리케이션의 대화 흐름을 바꾸지 않으면서 사전 채움 작업을 줄일 수 있고, 멀티토큰 예측은 도구 응답 뒤에 이어지는 생성 단계를 겨냥합니다.

메모리 절감은 원시 속도만큼 중요할 수 있습니다. 270억 파라미터 모델이 저정밀 형식으로 실행되더라도 긴 컨텍스트, 런타임 상태, 애플리케이션 로직을 위한 여유 공간이 필요합니다. NVIDIA가 128GB 통합 메모리를 사용한 점은 엣지 배포가 모델 단독이 아니라 모델과 에이전트의 결합된 풋프린트를 중심으로 설계될 가능성이 높아지고 있음을 시사합니다.

기업 구매자에게 이 벤치마크는 지연 시간, 연결성, 데이터 통제가 중요한 워크플로에서 로컬 에이전트 추론이 점점 더 실용적이 되고 있다는 신호를 제공합니다. 하지만 대상 환경에서 전력 소비, 모델 정확도, 도구 호출 신뢰성, 업데이트 프로세스, 안전 제어를 평가해야 한다는 필요성은 사라지지 않습니다. 더 빠른 벤치마크 실행은 에이전트가 올바른 결정을 내리고 실제 하드웨어 제약 하에서 일관되게 동작할 수 있을 때만 유용합니다.

이 결과는 대안 런타임에 대한 경쟁 압력도 높입니다. 여기서 TensorRT Edge-LLM의 우위는 NVIDIA 소프트웨어와 Blackwell 하드웨어의 긴밀한 조율에서 나옵니다. 다른 가속기를 사용하는 개발자들은 긴 에이전트 경로에서 비슷한 성능을 원한다면 저정밀 커널, 지속적인 컨텍스트 상태, 추론적 또는 트리 기반 디코딩에 대한 유사한 지원이 필요합니다.

앞으로 주목할 점

다음으로 유용한 신호는 MLPerf 결과의 독립적인 재현이며, 특히 완료 시간과 함께 에너지 소비, 열 제한, 정확도를 보고하는 비교입니다. 캐시 재사용이 덜 반복적인 컨텍스트나 더 다양한 도구 출력이 있는 워크로드에서도 계속 효과적인지 보는 것도 중요합니다.

개발자는 TensorRT Edge-LLM 릴리스 브랜치와 MLCommons Edge Agentic 예제를 주시하며 업데이트된 모델 지원, 빌드 지침, 추가 하드웨어 제출을 확인해야 합니다. Qwen3.6-27B NVFP4에 대한 더 광범위한 테스트는 보고된 성능이 벤치마크의 기록된 궤적에만 국한되지 않고 생산용 에이전트에도 실용적인지 명확히 하는 데 도움이 될 것입니다.

마지막으로, 실제 배포된 차량, 로봇, 산업 시스템에서 나온 증거는 이 접근법에 대한 더 강한 시험이 될 것입니다. 이러한 환경에는 간헐적 연결성, 엄격한 전력 예산, 센서 입력, 안전 요구사항, 소프트웨어 업데이트가 포함되며, 현재 벤치마크는 이를 완전히 포착하지 못합니다.

Creati.ai 관점

NVIDIA의 결과는 시스템 시연으로 이해하는 것이 가장 좋습니다. 엣지 에이전트 성능은 원시 생성 속도를 높이는 것만큼이나 반복 작업을 피하는 데 달려 있습니다. NVFP4, FP8 KV 캐시, 상태 재사용, 트리 기반 디코딩의 조합은 도구를 사용하는 긴 대화에서 발생하는 특정 비용을 해결합니다.

6.4배라는 수치는 보고된 MLPerf 설정 안에서는 설득력이 있지만, 더 넓은 결론은 보다 신중합니다. AI 빌더에게 중요한 질문은 이러한 최적화가 서로 다른 모델, 도구, 전력 한계, 실제 정확도 요구사항을 넘어 계속 유효한지 여부입니다. 만약 그렇다면 로컬 에이전트 배포는 고립된 시연에서 더 신뢰할 수 있는 생산 아키텍처로 이동할 수 있습니다.

광고