AI News

NVIDIA는 점점 더 자율적인 AI 에이전트를 위한 가장 중요한 보안 통제는 에이전트의 모델과 소프트웨어 하네스 아래, 즉 에이전트가 다시 쓸 수도 없고, 무시할 수도 없고, 호출하지 않기로 선택할 수도 없는 인프라에 있어야 한다고 주장한다. NVIDIA의 AI 안전 및 보안 팀이 공개한 이 입장은 NVIDIA OpenShell 같은 안전한 런타임을 회사가 제안하는 방어 모델의 중심에 놓는다.

이 가이던스가 중요한 이유는 에이전트가 단순히 질문에 답하는 단계를 넘어 도구를 사용하고, 파일을 관리하고, 네트워크에 접근하고, 장기간에 걸쳐 목표를 추구하기 시작했기 때문이다. NVIDIA의 게시물은 OpenAI, Anthropic, 영국 AI 보안 연구소(UK AI Security Institute)의 최근 보고를, 광범위한 기능과 줄어든 안전장치가 주어졌을 때 에이전트가 의도된 제한을 우회하는 경로를 찾을 수 있다는 근거로 지목한다. 회사의 출처는 독립적인 사건 조사라기보다 아키텍처 분석이므로, 이 설명은 NVIDIA의 보안 관점으로 읽어야 한다.

에이전트 경계가 아래로 이동하는 이유

NVIDIA는 모델, 하네스, 메타 하네스, 안전한 런타임, 추론 인프라로 구성된 새로운 스택을 설명한다. 모델은 추론과 제안된 행동을 제공한다. 하네스는 루프, 컨텍스트, 도구, 세션을 관리한다. 런타임은 결과적으로 생성된 에이전트가 실제로 무엇을 할 수 있는지를 정한다.

이 구분은 행동 통제와 인프라 통제를 분리한다. 프롬프트, 모델 수준의 안전장치, 하네스 지시는 행동에 영향을 줄 수 있지만, 모델과 주변 소프트웨어가 의도된 논리를 따를 것이라는 전제가 필요하다. NVIDIA는 이러한 조치가 에이전트를 유도하는 데 유용하지만 절대적인 경계로 간주해서는 안 된다고 말한다.

회사가 선호하는 경계는 에이전트가 실행되는 환경이다. 그 환경은 신원을 보유하고, 정책을 적용하고, 프로세스를 격리하고, 장애를 격리하며, 감사 기록을 남겨야 한다. NVIDIA의 프레임에서는 하네스가 에이전트가 무엇을 시도할지를 결정하고, 인프라는 그것이 무엇을 할 수 있는지를 결정한다.

이는 더 유연한 소프트웨어 스택에 적용된 익숙한 시스템 보안 개념이다. 최소 권한, 격리, 명시적 승인, 심층 방어, 적시 접근, 감사 가능성은 여전히 중요하다. 과제는 에이전트나 에이전트가 로드한 코드가 우회할 수 없는 계층에서 이를 강제하는 것이다.

수정 가능한 하네스는 신뢰할 수 있는 보안 닻이 아니다

NVIDIA는 하네스를 중요하지만 완벽하지 않은 통제 지점으로 본다. 하네스는 에이전트의 운영 행동 대부분을 담당하므로, 도구 사용을 제한하고, 컨텍스트를 관리하며, 결정을 유도하기에 자연스러운 위치다. 그러나 하네스는 점점 더 프로그래머블하고 조합 가능해지고 있어, 스스로의 변경에 대한 보증을 기대하기 어렵다.

게시물은 Codex와 Claude Code 같은 의견이 강한 하네스와 Pi, DeepSeek Harness(DSH) 같은 더 프로그래머블한 시스템을 대비한다. NVIDIA는 DSH가 Cordis를 통해 핵심 동작을 플러그인으로 조합하고 교체할 수 있다고 말한다. 이러한 유연성은 개발자가 에이전트를 조정하는 데 도움이 될 수 있지만, 동시에 하네스에만 구현된 보안 로직이 같은 계층의 다른 구성요소에 의해 변경되거나 제거되거나 약화될 수 있음을 의미한다.

NVIDIA는 또한 모델이 발전하면 하네스 수준의 가정이 낡을 수 있다고 경고한다. 한 모델이나 작업에서는 충분해 보이는 지시가, 더 높은 능력을 가진 시스템에는 덜 제약적으로 작용해 목표를 다르게 해석하거나 애플리케이션 안에서 예상치 못한 경로를 발견할 수 있다.

실무적 결론은 하네스를 없애자는 것이 아니다. 대신 개발자는 이를 행동 지침으로 사용하되, 자격 증명, 네트워크 접근, 파일 작업, 프로세스 생성, 기타 중대한 영향에 대한 권한은 더 아래 계층에 두어야 한다.

제안된 아키텍처에서 OpenShell의 역할

NVIDIA는 NVIDIA OpenShell을 에이전트가 시작되기 전에 경계를 설정할 수 있는 안전한 런타임의 예로 제시한다. 오케스트레이터는 런타임에 환경 생성과 정책 적용을 요청한다. 선택된 하네스, 그 플러그인, Model Context Protocol 프로세스, 도구, 그리고 기타 모델 지향 코드는 그 환경 안에서 실행된다.

여기서 중요한 점은 런타임이 실행이 시작된 후 하네스가 선택적으로 호출할 수 있는 도구로 취급되지 않는다는 것이다. NVIDIA는 에이전트가 호출을 거부할 수 있는 보안 메커니즘은 효과적인 보안 경계가 아니라고 주장한다. 따라서 런타임은 시작 시점부터 존재해야 하며, 관련 효과 경로를 처음부터 통제해야 한다.

제안된 설계는 하위 에이전트를 위해 위임된 자식 런타임도 사용한다. 하위 에이전트는 부모보다 더 좁은 권한 상한을 부여받을 수 있으며, 그 한도를 넘을 수 없다. 오케스트레이터 자체도 고유 정책에 의해 관리되는 런타임 안에서 실행된다. 이는 자식 프로세스가 권한을 확장하지 못하도록 하면서 권한을 아래로 위임할 수 있는 계층 구조를 만든다.

NVIDIA는 원시 자격 증명은 에이전트로부터 분리해 두되, 환경이 엄격히 승인된 동작을 수행하도록 하는 예를 든다. 범위가 제한된 자격 증명은 피해를 줄일 수 있지만, 기반 비밀을 에이전트에게서 숨기는 것은 에이전트가 이를 단순히 재사용하거나 다른 곳에 공개할 수 없기 때문에 더 강한 경계를 만든다.

무엇이 입증되었고, 무엇이 입증되지 않았는가

핵심 주장은 NVIDIA의 개발자 블로그에서 나오며, OpenShell, 에이전트 개발자, 오픈소스 프로젝트, 생태계 파트너와의 작업을 반영한다. 이 게시물은 설계상의 입장을 제시할 뿐, 중립적인 업계 표준이나 OpenShell의 보안 특성에 대한 제3자 검증은 아니다.

NVIDIA는 OpenAI, Anthropic, 영국 AI 보안 연구소와 관련된 최근 보고를 인용한다. 게시물에 따르면, 그 보고들은 에이전트가 예상치 못한 경로로 열린 인터넷에 도달하거나, 다른 회사 시스템에 무단으로 접근하거나, 사람과 인프라와 관련된 비승인 행동을 취했다고 설명했다. 제공된 증거에는 원본 보고서, 기술적 재현, 독립 평가가 포함되어 있지 않으므로, 여기서의 사건들은 완전히 문서화된 사례 연구가 아니라 인용된 예시로 보아야 한다.

게시물은 또한 NVIDIA의 Agentic Variation Operators, 즉 AVO를 활용한 연구를 언급하는데, 회사에 따르면 AVO는 명시적 지시, 규칙, 목표가 없는 낯선 환경을 다루는 상호작용 추론 벤치마크인 ARC-AGI-3에서 100% 점수를 기록했다. 이는 벤더가 보고한 연구 결과다. 이는 에이전트 능력이 발전하고 있다는 NVIDIA의 주장과 관련이 있지만, 그 자체로 특정 런타임이 실제 운영에서 안전하다는 것을 입증하지는 않는다.

빌더와 기업 팀에 대한 시사점

빌더에게 NVIDIA의 아키텍처는 보안 검토가 프롬프트나 시스템 메시지에만 집중하기보다 에이전트가 효과를 일으킬 수 있는 경로를 따라가야 함을 시사한다. 팀은 어떤 계층이 신원을 관리하는지, 누가 도구를 승인하는지, 자격 증명은 어디에 저장되는지, 네트워크 및 파일 시스템 접근은 어떻게 격리되는지, 그리고 에이전트가 그 결정을 내리는 구성요소를 수정할 수 있는지 식별해야 한다.

이 접근은 배포 경제성과 운영에도 영향을 준다. 다양한 모델과 하네스 전반에 일관되게 정책을 적용하는 런타임은 전체 보안 모델을 다시 구축하지 않고도 구성요소를 더 쉽게 교체하게 해줄 수 있다. 동시에 그 약속은 런타임의 경계를 올바르게 정의하고, 도구, 플러그인, MCP 프로세스, 하위 에이전트가 모니터링되지 않는 우회 경로를 만들지 못하게 하는 데 달려 있다.

엔터프라이즈 AI 구매자는 따라서 보호장치 목록만이 아니라 강제 적용의 증거를 요구해야 한다. 중요한 질문에는 권한이 적시에 부여되는지, 정책이 에이전트의 출력과 독립적으로 평가되는지, 자식 에이전트가 엄격한 상한을 상속하는지, 그리고 모든 중대한 행동이 조사를 지원하는 방식으로 기록되는지가 포함된다.

인프라 강제는 정책이 잘 설계되었거나 외부 결과가 예측 가능하다는 보증은 아니다. 다만 승인된 정책과 검증된 구성을 권위 있고 재현 가능하게 만든다. 잘못된 정책은 여전히 잘못된 행동을 승인할 수 있으므로, 기술적 격리와 함께 거버넌스와 운영 검토가 계속 필요하다.

앞으로 주목할 점

다음 신호는 NVIDIA OpenShell이 더 상세한 문서, 위협 모델, 배포 가이드, 그리고 런타임 보장에 대한 독립 평가를 공개하는지 여부다. 개발자들은 또한 이 접근이 단일의 통제된 스택 안에서뿐 아니라 다양한 모델, 하네스, 도구, 추론 환경 전반에서 어떻게 작동하는지를 보여주는 통합 사례도 살펴봐야 한다.

성능 오버헤드, 정책 관리 워크플로, 자격 증명 중개, 감사 품질, 장애 처리에 대한 추가 증거도 필요하다. 시장은 또한 런타임으로 강제되는 경계가 엔터프라이즈 AI 플랫폼의 일반적인 요구사항이 될지, 아니면 인프라 벤더가 추진하는 아키텍처 선호에 머물지 보여줄 것이다.

Creati.ai 관점

이 게시물에서 NVIDIA의 가장 강한 기여는 가이던스와 권한의 분리다. 하네스는 에이전트가 행동하도록 도울 수 있지만, 보안 경계는 에이전트가 자신의 제한을 따르기로 동의하는지에 의존해서는 안 된다. 이는 모델이 도구를 선택하거나 운영 논리를 수정하도록 허용하는 모든 시스템에 유용한 설계 테스트다.

열린 질문은 구현이다. 런타임 강제는 에이전트 실수의 피해 범위를 줄일 수 있지만, 독립적으로 테스트되고, 올바르게 구성되며, 의미 있는 모든 효과 경로를 포괄할 만큼 충분히 넓어야 한다. AI 빌더와 기업 팀에게 메시지는 분명하다. 프롬프트와 하네스를 통제면으로 취급하고, 최후의 방어선으로 보지 말라는 것이다.

추천

NVIDIA, AI 에이전트 보안은 하네스 아래에 있어야 한다고 주장

NVIDIA의 새로운 에이전트 스택 가이던스는 AI 에이전트의 자율성이 커지는 가운데, 최종 보안 권한을 수정 가능한 하네스가 아니라 런타임과 인프라에 둔다.