
Linux Foundation은 AI 에이전트와 관련된 사이버보안 사고에 대한 정보를 수집하고 공유하기 위한 제안된 프레임워크인 Shared AI Findings Exchange, 즉 SAFE에 대한 의견 요청(Request for Comments)을 발표했다. 이 이니셔티브는 기업들이 모델 테스트에서 도구, 데이터, 엔터프라이즈 애플리케이션에 접근할 수 있는 시스템으로 이동하는 가운데 Open Secure AI Alliance에 의해 개발되고 있다.
NVIDIA 블로그 게시물에 따르면 NVIDIA, Cisco, CrowdStrike, Hugging Face, Red Hat 등이 이 제안에 기여하는 조직에 포함된다. 이 연합은 현재 120개가 넘는 조직을 포함한다고 밝혔다. 핵심 아이디어는 사고와 아차사고에 대한 기밀 보고를 증거 기반 지침으로 전환해 다른 개발자들이 같은 실패를 피할 수 있도록 돕는 것이다.
SAFE 제안은 기존의 취약점 공개를 넘어선다. NVIDIA가 설명한 지침은 AI 관련 사고의 기밀 수집 및 분석, 영향을 받는 당사자에 대한 통지, 반복되는 통제 실패의 식별, 그리고 시스템적 위험을 줄이기 위한 운영 권고의 공개를 요구한다.
이 범위는 AI 시스템이 구축되는 방식의 변화를 반영한다. 에이전트는 단순한 모델이 아니라 오케스트레이션 하네스, 신원 통제, 도구, 런타임 제한, 가드레일, 로깅 및 평가 시스템을 포함할 수 있다. 이러한 계층 중 어느 하나의 취약점도 에이전트가 무엇을 보고, 접근하고, 변경할 수 있는지에 영향을 줄 수 있다.
개발자 입장에서는 공유된 사고 형식이 제품과 배포 전반에서 에이전트 보안 실패를 더 쉽게 비교하게 해줄 수 있다. 오늘날 프롬프트 인젝션, 도구 오용, 유출된 자격 증명, 안전하지 않은 자율 행동에 관한 정보는 개별 기업 내부에 머물 수 있다. SAFE의 제안된 접근은 민감한 운영 세부사항을 즉시 노출하지 않으면서 교훈을 공유할 수 있는 메커니즘을 만들고자 한다.
이 제안은 아직 초안 상태다. 공개된 발표에는 전체 보고 분류체계, 거버넌스 모델, 참여 요건, 또는 지침 최종화 일정이 명시되어 있지 않다.
NVIDIA는 Open Secure AI Alliance 회원들의 더 넓은 보안 기여와 함께 SAFE를 소개했다. 자사 예시에는 NVIDIA Labs Object-Oriented Agent 연구 하네스가 포함되며, 회사는 이것이 에이전트 행동을 더 쉽게 테스트, 추적, 감사하도록 설계되었다고 말한다. 또한 NVIDIA OpenShell은 에이전트가 접근하고 수행할 수 있는 것을 제한하기 위한 런타임이다.
NVIDIA는 또한 데이터 유출, 프롬프트 인젝션, 탈옥(jailbreak) 동작 등의 문제를 점검하는 오픈소스 대형 언어 모델 취약점 스캐너 Garak도 강조했다. 다른 언급된 도구로는 NeMo Guardrails, NeMo Anonymizer, NeMo Safe Synthesizer가 있으며, 정책 시행, 민감 데이터 보호, 프라이버시 지향 합성 데이터 생성을 담당한다.
여러 연합 회원이 스택의 다양한 지점에서 도구를 제공하고 있다. Okta는 Cross App Access를 사용한 에이전트 신원 및 접근에 대한 참조 구현을 개발 중이다. Palo Alto Networks는 자사의 Idira 신원 보안 플랫폼에서 Agent Guard와 Agent Watch를 기여했다. Red Hat은 거버넌스 요구 사항을 런타임 권한과 감사 기록에 매핑하는 오픈소스 프로젝트 asago를 도입했다고 NVIDIA는 밝혔다.
게시물에서 새로운 연합 회원으로 설명된 Amazon은 Strands Agents와 Cedar를 기여하고 있다. Strands Agents는 에이전트 구축을 위한 오픈소스 툴킷이며, Cedar는 접근 경계를 정의하고 강제하도록 설계된 인가 언어다. 이 프로젝트들은 SAFE만으로는 해결할 수 없는 구현 문제, 즉 에이전트가 무엇을 할 수 있는지, 어떤 신원을 사용하는지, 그리고 그 결정이 어떻게 기록되는지를 다룬다.
핵심 소식은 NVIDIA 출처로 확인된다. Linux Foundation은 SAFE에 대한 RFC를 발행했고, Open Secure AI Alliance 작업 그룹이 이에 기여하고 있다. 회원 수와 참여 도구에 대한 설명도 오픈 AI 보안 인프라를 추진하는 데 직접적인 이해관계가 있는 연합 회원인 NVIDIA에서 나온 것이다.
이용 가능한 출처에는 SAFE에 대한 독립적인 테스트, 해당 프레임워크가 기업에 채택되었다는 증거, 또는 나열된 도구가 실제 운영에서 사고율을 낮춘다는 증명이 포함되어 있지 않다. 따라서 NVIDIA 제품과 다른 회원들의 기여에 대한 주장은 독립적으로 검증된 성능 결과가 아니라 공급업체 또는 참여자 설명으로 보아야 한다.
또한 SAFE가 공식 표준이 되었다는 징후도 아직 없다. RFC는 검토와 수정의 기회를 제공하지만, 실제 가치는 조직들이 무엇을 보고할지, 사고를 어떻게 익명화할지, 그리고 유용한 발견이 개발자와 운영자에게 얼마나 빨리 전달되는지에 합의할 수 있는지에 달려 있다.
에이전트를 배포하는 제품 팀에게 가장 중요한 잠재적 이점은 운영 학습이다. 공통의 보고 구조는 보안 엔지니어가 고립된 모델 행동과 권한, 도구 통합, 오케스트레이션 로직, 또는 약한 모니터링으로 인한 실패를 구분하는 데 도움이 될 수 있다. 모델을 바꾸는 것만으로 주변 시스템에 존재하는 취약점을 해결하지 못할 수 있기 때문에 이러한 구분은 중요하다.
기업 구매자도 공급업체를 평가할 때 성숙한 SAFE 프로세스를 살펴볼 수 있다. AI 제공업체가 사고 공개에 참여하는지, 아차사고를 어떻게 다루는지, 그리고 그 통제가 구체적인 증거와 연결되는지를 물을 수 있다. 그러나 이러한 이점은 프레임워크가 적용하기 어려운 광범위한 경고가 아니라 일관되고 실행 가능한 보고서를 생산할 때만 실현된다.
이 이니셔티브는 AI 인프라에서의 경쟁적 긴장도 드러낸다. 오픈소스 보안 도구는 검사 가능성과 이식성을 개선할 수 있고, 공유 보고는 공급업체 전반의 반복되는 약점을 드러낼 수 있다. 동시에 기업은 고객 데이터, 독점 시스템 또는 평판 리스크가 관련된 사고를 공개하는 데 주저할 수 있다. SAFE의 기밀성과 거버넌스 규칙은 이러한 긴장을 해결하는 핵심이 될 것이다.
다음 신호는 Linux Foundation의 피드백 절차 내용이 될 것이다. 특히 SAFE가 사용 가능한 사고 스키마, 민감 정보에 대한 명확한 보호, 그리고 영향을 받는 조직에 통지할 책임을 정의하는지 여부다.
개발자들은 추가적인 회원 발표보다 구현의 증거도 주시해야 한다. 유용한 지표로는 익명화된 사고 보고서 공개, 에이전트 가시성(observability) 및 평가 도구와의 통합, 그리고 공유된 발견이 권한, 런타임 제어 또는 배포 정책 변경으로 이어진 사례가 있다.
마지막으로 시장은 SAFE가 NIST 및 OWASP 지침을 포함한 기존 보안 및 거버넌스 프레임워크와 연결되면서 또 다른 분리된 준수 계층을 만들지 않는지를 확인해야 한다. 창립 연합 외부 조직의 채택은 현재 참여자 수보다 더 강한 시험이 될 것이다.
SAFE는 에이전트 보안의 실제 약점을 다룬다. 팀은 모델, 도구, 엔터프라이즈 자원을 가로질러 동작할 수 있는 시스템을 관리해야 하는데, 사용 가능한 지식의 상당 부분은 여전히 파편화되어 있다. 사고와 아차사고를 위한 공유 프로세스는 방어적 엔지니어링을 더 누적적인 것으로 만들고, 모든 회사가 같은 실패 모드를 다시 발견하게 만드는 일을 줄일 수 있다.
하지만 제안의 신뢰성은 실행에 달려 있다. 프레임워크에는 정확한 보고 규칙, 솔직한 참여를 유도하는 인센티브, 그리고 개발자들이 실제로 배포할 수 있는 통제를 만들어낼 만큼의 충분한 기술적 세부사항이 필요하다. 이러한 요소들이 보이기 전까지 SAFE는 입증된 보안 솔루션이 아니라 중요한 표준화 노력으로 이해하는 것이 가장 좋다.
Linux Foundation은 대규모 에이전트형 시스템을 보호하기 위해 AI 보안 리더들이 지지하는 제안된 사고 공유 프레임워크 SAFE에 대한 피드백을 구하고 있다.