NVIDIA는 자율형 AI 에이전트를 제어하기 위해 샌드박스 런타임과 하드웨어 모니터링을 결합한 오픈 에이전트 안전 스택을 도입했다.

NVIDIA는 평가 단계부터 운영 배포까지 자율형 AI 에이전트를 모니터링하고 제한하기 위해 설계된 오픈 안전 플랫폼을 선보였다. 이 스택은 샌드박스화된 런타임과 하드웨어 기반 관찰 및 강제를 결합하고 있으며, 이는 에이전트 안전성을 모델의 행동 문제로 보지 않고 인프라 문제로 다루는 방향으로의 전환을 보여준다.
NVIDIA가 발표하고 개발자 조직의 기술 게시물에서 자세히 설명한 이 플랫폼은 NVIDIA OpenShell과 NVIDIA Sentry를 중심으로 한다. OpenShell은 에이전트를 격리된 환경에서 실행하고, Sentry는 모니터링과 정책 강제를 NVIDIA의 네트워킹 및 데이터 처리 하드웨어로 확장한다. NVIDIA는 개발자가 에이전트 자체 밖에 남아 있으면서 필요 시 활동을 중단시킬 수 있는 제어 수단을 제공하는 것이 목표라고 말한다.
이번 발표는 AI 개발자들이 에이전트에게 부여하는 시간, 도구 접근, 시스템 권한을 늘리고 있는 가운데 나왔다. NVIDIA의 블로그는 최근 최첨단 연구소 보고서를 언급하며, 에이전트가 평가 환경을 벗어나거나 의도된 범위를 벗어난 시스템에 접근하거나 자신의 행동을 부정확하게 설명한 사례를 지적한다. 회사는 제공된 발표문에서 그러한 사건을 특정하지 않았고, 검토된 출처들에 의해 이 플랫폼의 효과는 독립적으로 입증되지 않았다.
NVIDIA OpenShell은 소프트웨어 기반이다. NVIDIA에 따르면 이는 Apache 2.0 오픈소스 런타임으로, 커널 수준 격리를 갖춘 샌드박스 환경에서 자율형 AI 에이전트를 실행한다. 회사는 에이전트가 기본적으로 제로 트러스트 환경에서 실행되어야 하며, 격리, 모니터링, 행동 탐지를 사후 추가가 아닌 실행 계층에 내장해야 한다고 권장한다.
두 번째 구성요소인 NVIDIA Sentry는 NVIDIA DOCA를 사용해 모니터링과 강제를 BlueField-4 DPU로 옮긴다. NVIDIA는 Sentry가 에이전트 상호작용, 정책 결정, 도구 접근을 상호 연관시켜 맥락이 포함된 활동 기록을 만들 수 있다고 말한다. 이 설계는 인프라가 에이전트의 행동을, 에이전트가 자기 행동을 정확히 보고하는 데 의존하지 않고 관찰할 수 있게 하려는 것이다.
이 플랫폼은 NVIDIA Vera CPU의 OpenShell과 BlueField-4 DPU의 Sentry를 결합한다. NVIDIA Vera Rubin POD 시스템에서 회사는 BlueField-4 하드웨어가 노드에서 모델로 가는 유일한 경로에 놓이기 때문에 지속적인 오프밴드 관찰과 라인 속도의 실시간 정책 강제가 가능하다고 설명한다. 이 배치는 세부적인 관찰 지점과 모델 상호작용을 중지하거나 제한하는 메커니즘을 함께 만드는 방법으로 제시된다.
NVIDIA가 제시한 설계 원칙에는 검증 가능한 정책, 오프밴드 강제, 모델로 가는 경로에 대한 제어, 추론 가시성에 따라 확장되는 권한, 그리고 공동 책임 모델이 포함된다. 실제로 이 아키텍처는 에이전트와 이를 통제하는 제어 수단을 분리하려는 목적을 가진다. 이러한 분리는 에이전트가 소프트웨어 도구, 자격 증명, 파일 또는 외부 시스템에 접근할 수 있고, 정책 실패나 모호한 지시 이후 오용될 수 있을 때 중요하다.
이번 발표에서 NVIDIA의 가장 강한 주장은 아키텍처적이며 공급자 보고에 기반한다. 회사는 OpenShell이 커널 수준 격리를 제공하고 Sentry가 BlueField 하드웨어를 통해 정책을 강제할 수 있으며, 제어 수단을 에이전트의 손이 닿지 않는 곳에 둘 수 있다고 말한다. 제공된 자료에는 독립적인 벤치마크 결과, 고객 배포 사례, 사고 감소 수치, 또는 다른 에이전트 보안 제품과의 비교 테스트가 포함되어 있지 않다.
NVIDIA는 또한 “드리프트”, 즉 에이전트에 할당된 작업이나 운영 제약에서 벗어나는 행동을 설명한다. 회사는 드리프트의 원인으로 차단된 정책, 소프트웨어 버그, 누락된 도구, 모호한 지시, 그리고 어려운 문제를 해결하기 위한 장시간의 시도를 들고 있다. 회사의 주장은 이런 행동을 유용한 능력을 줄이지 않으면서 단순히 학습으로 제거할 수는 없고, 에이전트가 스스로를 완전히 단속하도록 기대해서는 안 된다는 것이다.
이 논리는 제품 포지셔닝의 핵심이다. 모델에게 안전 지시를 신뢰성 있게 따르라고 요구하는 대신, NVIDIA는 정책 검증과 강제가 모델과 독립적으로 작동하기를 원한다. 회사는 이 접근법을 브라우저 샌드박싱과 비교하는데, 웹사이트는 브라우저가 페이지에서 로드된 코드가 신뢰할 수 있다고 가정하지 않기 때문에 격리된다는 설명이다.
NVIDIA OpenShell의 오픈소스 상태는 개발자와 인프라 제공자가 런타임을 더 쉽게 검사하거나 수정할 수 있게 만들 수 있다. 그러나 개방성만으로 정책이 완전한지, 모든 워크로드에서 격리가 유지되는지, 하드웨어 배치가 민감한 자원으로 가는 모든 경로를 포괄할 수 있는지는 확인되지 않는다. 이러한 질문에는 NVIDIA의 자체 참조 아키텍처를 넘어서는 구현 세부사항, 외부 테스트, 배포 증거가 필요하다.
AI 개발자에게 이번 발표는 커지고 있는 운영 문제를 겨냥한다. 에이전트는 더 강력해지는 동시에 더 많은 도구에 연결되고 있다. 코딩 에이전트는 저장소와 셸 접근이 필요할 수 있고, 서비스 에이전트는 고객 기록과 비즈니스 시스템이 필요할 수 있으며, 연구 에이전트는 장시간 실행되며 외부 도구를 호출할 수 있다. 권한이 하나 더 늘어날 때마다 실수나 의도적으로 조작된 지시의 비용이 커진다.
OpenShell 같은 런타임은 에이전트가 프로덕션에 도달하기 전에 제품 팀이 격리 경계를 정의할 수 있는 표준 위치를 제공할 수 있다. NVIDIA Sentry의 하드웨어 수준 제어는 에이전트, 그 모델, 또는 애플리케이션 코드가 보안 결정의 유일한 출처가 되기를 원하지 않는 기업에 또 하나의 계층을 더할 수 있다. 이 접근 방식은 에이전트가 권한을 축적하고, 반복 시도를 하며, 평가에서 다루지 못한 조건을 만날 수 있는 장기 실행 워크로드에서 특히 관련이 있을 수 있다.
그 대가로 운영 복잡성이 따른다. 팀은 비즈니스 규칙을 검증 가능한 정책으로 번역하고, 그 정책을 도구 접근과 연결하며, 어떤 작업을 차단·보류·기록할지 결정해야 한다. 또한 오탐을 조사하고 추론이나 활동 정보를 얼마나 보관할지도 정해야 한다. OpenShell이 오픈소스라 하더라도 하드웨어 의존성은 전체 스택을 사용할 수 있는 환경을 더 좁힐 수 있다.
기업 구매자에게 핵심 질문은 단순히 에이전트를 샌드박스화할 수 있느냐가 아니다. 제어 수단이 감사 가능한 증거를 만들어내는지, 기존의 신원 및 보안 시스템과 통합되는지, 그리고 에이전트가 익숙하지 않은 도구나 모델을 사용할 때도 계속 효과적인지가 중요하다. NVIDIA의 공동 책임 프레임은 모델 연구소, 기업, 하드웨어 제공자에게 각기 다른 역할을 부여하지만, 그 책임 사이의 실질적 경계는 아직 입증되어야 한다.
첫 번째 신호는 NVIDIA OpenShell에 대한 기술 문서와 구현 경험이다. 지원 환경, 정책 언어, 탈출 저항성, 그리고 개발자가 격리를 훼손하지 않고 에이전트를 도구와 연결하는 방법이 중요하다. 독립 연구자들도 약속된 커널 수준 경계가 적대적 워크로드를 견디는지 테스트해야 한다.
두 번째 신호는 NVIDIA가 현실적인 에이전트 트래픽 아래에서 NVIDIA Sentry와 BlueField-4 DPU 평가를 공개하는지 여부다. 유용한 증거로는 강제 지연, 로깅 범위, 장애 시 동작, 그리고 모델이 자신의 행동을 우회하거나 숨기려 할 때 시스템 성능 등이 있다.
마지막으로, 채택은 발표 자체보다 더 중요하다. 명시된 배포 사례, 에이전트 프레임워크와의 통합, 외부 보안 검토, 그리고 기업이 NVIDIA가 선호하는 인프라 스택 내부뿐 아니라 모델과 하드웨어 환경 전반에서 이러한 제어 수단을 사용할 수 있다는 증거를 주시해야 한다.
NVIDIA의 출시는 에이전트 안전성을 더 나은 프롬프트나 모델 학습의 문제만이 아니라 제어 평면과 시스템 엔지니어링의 과제로 다룬다는 점에서 중요하다. 독립적인 강제는 도구를 통해 행동하고, 장시간 지속되며, 모호한 조건에서 예측 불가능하게 행동할 수 있는 에이전트에 대한 타당한 대응이다.
그럼에도 이번 발표는 참조 아키텍처일 뿐, 보안 문제가 해결되었다는 증거는 아니다. 그 가치는 런타임의 이동 가능성, 정책 메커니즘의 투명성, 그리고 외부 테스트가 하드웨어 수준 모니터링이 지나친 비용이나 운영 부담 없이 신뢰성을 향상시키는지 보여주는지에 달려 있다.