Google DeepMind, 평가 신뢰성 문제를 해결하기 위해 더블블라인드 AI 벤치마크 시험

Google DeepMind는 Gemini Flash Lite용으로 암호학적으로 보호된 더블블라인드 벤치마크를 시험하며, 오염을 줄이고 AI 평가에 대한 신뢰를 회복하는 것을 목표로 하고 있다.

AI News

모델 개발자가 평가 프롬프트를 보았을 가능성이 있거나 테스트 데이터가 학습 파이프라인에 들어갈 수 있을 때, AI 벤치마크 점수는 점점 해석하기 어려워지고 있다. Google DeepMind는 이제 이 과정의 양쪽이 서로의 민감한 정보에 접근하지 못하도록 설계된, 암호학적으로 보호된 더블블라인드 평가를 시험하고 있다.

Singapore AI Safety Institute와 다른 파트너들과 함께 진행된 이 시범 프로젝트는 Gemini Flash Lite 계열의 모델을 비밀 벤치마크에 대해 사용한다. Google은 이 접근 방식이 벤치마크 오염을 방지하는 동시에 독립 평가자들이 가중치를 받지 않고도 독점 모델을 테스트할 수 있게 하려는 것이라고 말한다.

이 프로젝트가 중요한 이유는 벤치마크 결과가 모델 선택, 연구 주장, 구매 결정, 안전 감독에 영향을 미치기 때문이다. 그러나 현재 उपलब्ध한 증거는 새로운 모델 성능 결과가 아니라 평가 방법에 관한 것이다. 시스템이 측정 정확도를 향상시키는지에 대한 보고된 점수나 독립적 평가는 없다.

Google이 테스트하는 것

The Decoder의 보도에 따르면, Google DeepMind는 Google Cloud의 Confidential Space를 사용해 시범 프로젝트를 위한 보호 환경을 만들고 있다. 이 구조는 외부 테스트 프롬프트를 Google로부터 숨기는 동시에 평가자들이 Gemini 모델 가중치를 검사하지 못하게 하도록 설계됐다.

핵심 아이디어는 더블블라인드 교환이다. 평가 기관은 모델 제공자에게 노출하지 않은 채 질문이나 과제를 제공한다. 제공자는 기반 가중치를 이전하지 않고 테스트용으로 모델을 제공한다. 그다음 암호학적 제어를 통해 합의된 구성요소가 의도된 환경에서 실행되고 있음을 검증한다.

Google은 이것을 독점적인 최전선 AI 모델에 대한 첫 더블블라인드 평가라고 설명하지만, 이는 The Decoder가 전한 회사의 주장일 뿐 독립적으로 확립된 업계의 사실은 아니다. 시범 모델은 Gemini Flash Lite이지만, उपलब्ध한 출처에는 어떤 버전인지, 벤치마크 과제, 테스트 규모, 최종 결과가 명시돼 있지 않다.

기술적 기반은 Google의 기밀 컴퓨팅 포트폴리오의 일부인 Confidential Space다. 원칙적으로 기밀 컴퓨팅은 하드웨어 기반 보호와 증명을 사용해 보호된 워크로드 안에서 운영자가 볼 수 있는 것을 제한할 수 있다. 이 경우 목표는 모델과 평가 데이터 사이에 검증 가능한 분리를 만드는 것이다.

벤치마크 오염이 중요한 이유

벤치마크는 그 질문이 테스트 대상 시스템에 새로울 때 가장 유용하다. 만약 프롬프트나 답변이 학습 데이터에 포함되었거나 모델이 테스트에 맞춰 특별히 조정되었다면, 높은 점수는 폭넓은 추론 능력이나 과제 수행 능력보다는 사전 노출을 반영할 수 있다.

이 문제는 일반적으로 벤치마크 오염이라고 불린다. 공개 데이터셋, 대규모 웹 학습, 반복적인 내부 테스트를 통해 우발적으로 발생할 수 있다. 또한 벤치마크가 널리 논의되고 모델 개발자들이 그에 맞춰 최적화할 시간이 생기면 전략적 문제가 될 수도 있다.

평가 과정 자체도 또 다른 위험을 만든다. 외부 기관은 그렇게 하면 독점 데이터, 정부 정보 또는 사이버 보안 테스트 자료가 노출될 수 있기 때문에 민감한 프롬프트를 모델 회사에 제공하는 것을 주저할 수 있다. 한편 모델 개발자는 일반적으로 귀중한 지적 재산을 나타내는 가중치를 넘기고 싶어하지 않는다.

The Decoder는 제로 로깅 합의와 계약상 제한 같은 전통적인 안전장치를 설명했지만, Google은 암호학적 보호가 더 강한 기술 계층을 추가한다고 주장한다. 제안된 시스템은 소프트웨어, 하드웨어, 운영 절차에 대한 신뢰의 필요성을 없애지는 않는다. 대신 단일 참여자에게 맡겨야 하는 신뢰의 양을 줄이는 것을 목표로 한다.

증거, 주장, 그리고 남은 한계

현재 उपलब्ध한 보도에서 가장 강한 주장은 Google DeepMind의 시범 설명에서 나온다. Google은 자사의 방법이 테스트 질문을 제공자에게서, 모델 가중치를 평가자로부터 차단하면서도, 모델이 비밀 질문을 사용해 특정 테스트에 최적화하는 것을 방지하는 데 도움을 줄 수 있다고 말한다.

그것들은 설계 목표이지, 이 보도에 사용할 수 있는 자료에서 독립적으로 검증된 결과는 아니다. The Decoder는 Google이 기술 보고서에서 방법론적 세부사항과 결과를 공개했다고 보도했지만, 제공된 증거에는 그 보고서의 발견이나 구현에 대한 외부 감사가 포함되어 있지 않다.

Gemini Flash Lite의 사용 역시 추론 가능한 범위를 제한한다. 이는 평가 설정이 독점 모델에서 작동함을 보여줄 수는 있지만, 모든 최전선 모델, 벤치마크 유형, 배포 환경이 같은 과정을 합리적인 비용과 속도로 사용할 수 있음을 입증하지는 않는다.

몇 가지 실무적 질문은 여전히 열려 있다. 출처는 평가 실행에 얼마나 시간이 걸리는지, Confidential Space가 어떤 계산 오버헤드를 도입하는지, 실패를 어떻게 처리하는지, 평가자가 테스트된 모델이 정확히 의도된 모델인지 어떻게 확인하는지 말해주지 않는다. 또한 이 방법이 보호 실행 전후의 데이터 유출을 어떻게 다루는지도 설명하지 않는다.

AI 개발자와 기업에 대한 시사점

AI 연구자에게 성공적인 더블블라인드 워크플로우는 민감한 테스트 데이터와 독점 가중치 사이에서 선택하도록 강요하지 않고도 독립 평가를 수행하기 쉽게 만들 수 있다. 이는 특히 사이버 보안 평가, 정부 테스트, 제한 정보가 포함된 기타 평가에 중요하다.

모델 제공자에게는 이 접근 방식이 시스템 노출을 제한하면서도 신뢰할 수 있는 외부 결과를 얻는 방법을 제공할 수 있다. 또한 제공자가 평가 전에 테스트 프롬프트를 보았는지에 대한 분쟁도 줄일 수 있다. 그러나 암호학적 제어만으로 벤치마크가 유용한 능력을 측정하고, 나쁜 과제 설계를 피하고, 실제 환경 성능을 예측한다는 보장은 없다.

기업 구매자는 평가 기관이 벤더 간 비교 가능성이 더 높은 보호 테스트 결과를 공개하기 시작하면 혜택을 볼 수 있다. 조달 팀은 모델 개발자가 공개되지 않은 절차로 생성한 점수보다 독립적으로 수행된 평가에 더 큰 비중을 둘 수 있다.

상업적 질문은 이 방법이 시범을 넘어 실용적이 될 수 있느냐는 것이다. 안전한 실행, 증명, 재현성, 감사 접근은 운영 복잡성을 더할 수 있다. 소규모 연구 그룹은 같은 과정을 운영할 인프라나 자금이 부족할 수 있으며, 이로 인해 높은 신뢰성을 요구하는 평가가 대형 클라우드 및 모델 제공자에게 집중될 가능성이 있다.

앞으로 주목할 점

다음으로 중요한 신호는 기술 보고서의 세부 수준이다. 개발자와 평가자는 암호 아키텍처, 증명 절차, 로깅 정책, 모델 식별 확인, 실패 모드에 대한 설명을 찾아봐야 한다.

발표 자체보다 독립적 재현이 더 중요하다. Singapore AI Safety Institute나 다른 참여 기관의 증거는 절차가 실제로 제공자의 프롬프트 접근을 막는지, 그리고 평가자가 모델 가중치가 보호 상태로 유지되는지를 확인할 수 있는지를 밝혀줄 수 있다.

추가 모델 계열과 더 민감한 벤치마크의 결과도 이 방법이 일반적인 평가 표준인지, 아니면 범위가 제한된 시연인지 보여줄 것이다. 비용, 지연 시간, 접근 요건이 정기적으로 사용할 수 있을지, 아니면 주목도 높은 테스트에만 사용할 수 있을지를 결정하게 된다.

Creati.ai 관점

Google DeepMind의 시범은 AI 벤치마킹의 실제 약점을 다루고 있다. 참가자들은 민감한 평가 자료를 검사하거나 보관하거나 이에 맞춰 최적화하지 않도록 서로를 신뢰해야 하는 경우가 많다. 그 신뢰의 일부를 검증 가능한 기술적 통제로 옮기는 것은 특히 안전성과 정부 평가에서 유용한 방향이다.

하지만 이번 발표는 벤치마킹 인프라에 대한 실험으로 읽어야지, 이제 벤치마크 점수가 신뢰할 수 있다는 증거로 읽어서는 안 된다. 이 접근 방식의 가치는 독립 감사, 투명한 프로토콜, 그리고 보호된 테스트가 연구자, 기업, 규제 당국의 의사결정 품질을 바꾼다는 증거에 달려 있다.

광고