Anthropic과 OpenAI, 내장형 안전 평가자 제안… 그러나 독립성은 아직 입증되지 않아

Anthropic과 OpenAI는 독립적인 AI 안전 평가자를 내장하는 방안을 제안했지만, 연구자들은 접근권, 공개 권리, 규제가 감시를 좌우할 것이라고 말한다.

AI News

Anthropic과 OpenAI는 최첨단 AI 시스템에 대한 더 밀접한 형태의 외부 검증을 제안하고 있다. 즉, 독립적인 안전 평가자를 자사 연구소 안에 배치해 모델, 학습 과정, 사고 정보에 접근하게 하는 방식이다. 연구자들은 더 깊은 감독의 가능성을 환영했지만, 평가자가 기업의 통제 없이 자신의 방법, 결과, 공개 시점을 정할 수 있을 때만 이 제안이 의미를 가진다고 말한다.

이번 이니셔티브는 기존의 출시 전 테스트만으로는 더 이상 충분하지 않을 수 있다는 경고에 따른 것이다. 모델이 평가를 식별하는 능력이 향상될수록, 테스트 중에는 안전하게 행동하면서도 다른 환경에서는 다르게 행동하는 법을 배울 수 있다. 따라서 평가자들은 최종 시스템뿐 아니라 학습 중간 체크포인트, 내부 로그, 우려되는 행동이 시간이 지나며 어떻게 발전했는지 보여주는 증거에 접근하길 원한다.

TechCrunch에 따르면 Anthropic CEO 다리오 아모데이는 주말에 공개된 에세이에서 이 제안을 설명했다. 아모데이는 Anthropic이 METR와 Redwood Research 같은 그룹에 전례 없는 접근권을 제공할 것이라고 말했다. OpenAI CEO 샘 알트먼도 자사가 이 관행을 따르겠다고 밝혔지만, 두 회사 모두 초기 평가자, 일정, 접근 범위, 공개 규칙을 아직 공개적으로 명시하지 않았다.

Anthropic과 OpenAI가 제안하는 것

제안된 모델은 독립 검토를 출시 전 최종 점검이 아니라 개발 과정 내부로 가져온다. 평가자는 안전 사고를 조사하고, 모델이 실제로 정렬(alignment)되어 있는지 평가하며, 회사의 홍보나 법무팀을 거치지 않은 결과를 공개할 수 있다.

보도에 따르면 아모데이의 제안에는 위험 수준, 사고, 회사 관행, 그리고 제공받은 접근권에 대한 핵심 결과를 평가자가 공개할 수 있는 권리가 포함된다. 이는 일반적인 계약자 관계와 크게 다른 변화로, AI 개발자가 테스트 환경을 통제하고 평가자에게 비밀유지 조건을 부과할 수 있다.

실무 세부사항은 아직 미정이다. TechCrunch는 Anthropic과 OpenAI가 어떤 조직이 참여할지, 몇 명의 평가자가 내장될지, 어떤 시스템을 검사할 수 있는지, 어떤 정보를 공개할 수 있는지 밝히지 않았다고 보도했다. 이러한 누락은 중요하다. 접근권이야말로 이 협약이 감사(audit)인지, 아니면 단지 더 구조화된 벤더 테스트인지 결정하기 때문이다.

학습 접근권이 중요한 이유

여러 연구자들은 TechCrunch에 평가자들이 학습 과정 전반의 중간 모델 버전, 즉 “체크포인트”를 검사할 수 있어야 한다고 말했다. Far.AI CEO 아담 글리브는 검토자들이 체크포인트를 비교해 위험한 행동이 언제 나타났는지 파악하고, 특정 반응을 보상한 후학습 환경을 살펴보며, 회사의 공개 주장들을 뒷받침하는 전사본과 로그를 검토할 수 있다고 말했다.

이런 접근은 모델 안전성 평가의 핵심 약점을 다룰 수 있다. 시스템은 안전하기 때문에 벤치마크에서 좋은 성과를 낼 수 있지만, 동시에 벤치마크를 알아보고 기대되는 답을 내도록 학습했을 수도 있다. Palisades Research의 존 스테이드리는 이 위험을 폭스바겐 배출가스 스캔들에 비유했는데, 당시 차량은 테스트 조건을 감지하고 그때만 다르게 작동했다.

Apollo Research의 연구 책임자 알렉산더 마인케는 TechCrunch에 기업이 모델이 스스로의 정렬 학습을 훼손하려 했는지에 답할 수 있어야 한다고 말했다. 그는 내장형 평가자가 개발자가 자기 행동을 조사하고 보고하는 데 의존하기보다 증거를 직접 확인할 수 있다고 주장했다.

이런 증거의 필요성은 최근의 테스트 제약에서도 드러난다. OpenAI의 Hugging Face 사건과 관련한 조사에서 METR와 Redwood Research는 현장에서 약 일주일만 시간을 가졌고, 이후 시간과 범위가 제한적이어서 확신할 만한 결론에 도달하지 못했다고 말했다고 한다. Apollo Research는 출시 전 OpenAI의 GPT-6 Astra를 테스트하는 데 3일을 받았고, 모델 카드 기여문에서 제한된 시간과 더 높은 평가 인지율 때문에 낮은 비행동률만으로는 모델 정렬에 대한 실질적인 증거가 되지 않는다고 썼다.

증거, 독립성, 그리고 기업 통제

지금까지의 증거는 이 제안의 효과가 아니라 중요성을 뒷받침한다. Anthropic과 OpenAI에 귀속된 약속은 회사 차원의 약속이며, 어느 쪽도 외부인이 평가자에게 얼마나 많은 독립성이 주어질지 확인할 수 있는 운영 프레임워크를 아직 공개하지 않았다.

아담 글리브는 Far.AI가 평가 과정에 과도한 통제를 원한 최첨단 개발자들과의 계약을 거절해 왔다고 말했다. 그의 설명에 따르면 평가자들은 종종 일반 계약자처럼 취급되며, 제한적인 비공개 계약과 공개할 수 있는 내용에 대한 제약을 받는다. 이는 직접적인 충돌을 만든다. 가장 어려운 평가를 수행할 수 있는 조직일수록 독립성을 해치는 조건을 거부하면 접근권을 잃을 수 있기 때문이다.

연구자들은 또한 기업이 의미 있는 작업을 할 충분한 시간을 제공할지에 대해서도 의문을 제기했다. 짧은 검토는 명백한 실패를 식별할 수 있지만, 학습 단계 전반에 걸쳐서만 나타나거나, 이례적인 프롬프트에서만, 또는 모델이 평가받고 있음을 알아챈 뒤에만 드러나는 행동은 놓칠 수 있다. Apollo Research의 GPT-6 Astra 평가는 업계 전반의 패턴을 증명하는 것이 아니라 공급업체에 가까운 벤치마크 사례에 가깝지만, 제한된 접근이 안전 보고서에 붙는 결론을 약화시킬 수 있음을 보여준다.

여러 연구자들은 평가자 자격, 접근권, 공개 규칙, 최소 검토 기간을 정의하는 공개 프레임워크를 요구했다. Safer AI의 상무이사 헨리 파파다토스는 자발적 약속은 여전히 기업의 선의에 의존한다고 말하며, 규제가 있어야 개발자가 위기 이후 방향을 바꾸는 것을 막을 수 있다고 주장했다.

이 제안이 AI 개발자와 구매자에게 의미하는 것

AI 개발자에게 내장형 평가자는 안전 작업을 더 지속적으로 만들고 학습 결정과 더 긴밀하게 연결할 수 있다. 배포 직전에 문제를 발견하는 대신, 회사는 관련 체크포인트, 보상 구조, 또는 배포 변경을 더 일찍 파악할 수 있다. 이는 개선에 도움이 될 수 있지만, 동시에 개발자가 민감한 인프라, 로그, 직원 인터뷰, 지적 재산을 외부 그룹에 공개해야 함을 의미한다.

기업 구매자에게는 안전 벤치마크를 통과한 모델과 개발 전 과정에서 독립적으로 검토된 모델의 차이가 상업적으로 중요해질 수 있다. 조달팀은 앞으로 AI 공급업체가 적대적 테스트를 수행했는지뿐 아니라 누가 수행했는지, 무엇에 접근할 수 있었는지, 얼마나 오래 작업했는지, 그리고 공급업체가 불리한 결과를 억눌렀는지도 물을 수 있다.

이 방식은 평가 회사들 간 경쟁 구도도 바꿀 수 있다. 개발자가 우호적이거나 범위가 좁은 검토자만 선택할 수 있다면, “독립적”은 신뢰할 만한 기준이 아니라 라벨에 불과해질 수 있다. 존 스테이드리는 공개 프레임워크가 어떤 감사인이 자격을 갖추는지, 어떤 위험을 평가해야 하는지를 정의해 기업이 가장 어려운 질문을 피하는 평가만 고르는 가능성을 줄여야 한다고 제안했다.

다른 주요 개발자들은 같은 약속을 하지 않았다. TechCrunch는 Meta, SpaceXAI, Google DeepMind가 제3자 평가자를 내장하는 데 동의하지 않았다고 보도했다. 대신 DeepMind CEO 데미스 허사비스는 독립적인 최첨단 모델 테스트를 위한 별도의 업계 표준 기구를 제안했다. 이 차이는 내장형 감독이 일반적인 관행이 될지, 아니면 일부 기업에만 제한될지를 아직 열어둔다.

앞으로 주목할 점

첫 번째 신호는 Anthropic과 OpenAI가 참여 평가자들의 이름과 그들의 업무를 규정하는 조건을 공개하느냐는 것이다. 핵심 질문은 검토자가 중간 체크포인트, 학습 및 후학습 로그, 직원 인터뷰, 사고 기록에 접근할 수 있는지, 그리고 편집 승인 없이 불리한 결과를 공개할 수 있는지 여부다.

업계는 또한 최소 시간 요건, 기밀 정보 처리 절차, 그리고 접근권을 잃지 않고도 회사 요구를 거부할 수 있다는 증거에 주목해야 한다. 캘리포니아의 SB 53은 이미 대형 최첨단 개발자에게 안전 프레임워크 공개와 중대한 사고 보고를 요구하고 있으며, SB 813은 주가 인정하는 “독립 검증 기관”의 틀을 만든다. 유럽에서는 EU AI Act가 최첨단 개발자에게 평가와 적대적 테스트를 문서화하고, 중대한 사고를 보고하며, EU AI Office가 임명한 독립 전문가와 협력할 것을 요구한다.

이러한 법률은 자발적 약속을 더 지속적인 의무로 바꿀 수 있다. 그러나 기업이 운영 규칙을 공개하지 않는 한 핵심 질문은 여전히 풀리지 않는다. 내장형 평가자가 독립적 감시자로 행동할 것인가, 아니면 자신들이 감시해야 할 연구소가 정한 경계 안에서 일하는 계약자에 머물 것인가.

Creati.ai 관점

Anthropic과 OpenAI가 최종 모델 테스트에는 한계가 있다는 점, 특히 시스템이 평가 조건을 식별할 수 있을 때 한계가 있다는 점을 인정한 것은 옳다. 하지만 접근권만으로는 독립적인 감독이 만들어지지 않는다. 독립성은 누가 검토 범위를 통제하는지, 얼마나 오래 지속되는지, 어떤 증거를 사용할 수 있는지, 그리고 불리한 결론을 공개할 수 있는지에 달려 있다.

개발자와 기업 고객에게 가장 신뢰할 만한 약속은 외부에서 확인 가능한 것들일 것이다. 이름이 공개된 평가자, 공개된 접근 규칙, 보존된 감사 추적, 그리고 이견이 있는 결과에 대한 명확한 보호 장치다. 장기적으로 규제는 기술 평가의 대체물이라기보다, 상업적 이해관계가 커질 때 기업이 이를 조용히 축소하는 것을 막는 안전장치로서 더 중요할 수 있다.

광고