보고서에 따르면 중국 AI 개발업체들이 안전성 테스트를 공개적으로 문서화한 모델 출시는 3.6%에 불과해 구매자들 사이에서 투명성 우려가 커지고 있다.

Reuters, The Economic Times, marketscreener.com이 인용한 보고서에 따르면 중국 AI 개발업체들이 모델 출시의 3.6%에 대해서만 안전성 테스트 결과를 공개했다. 이 결과는 모델 공개 속도와 사용자, 규제기관, 기업 구매자가 이용할 수 있는 안전성 근거의 양 사이에 상당한 격차가 있음을 보여준다.
보고서의 핵심 통계는 현재 보도에서 확인할 수 있는 중심 사실이다. 제공된 자료는 보고서 작성자, 표본 규모, 기간, 모델 출시의 정의, 공개된 것으로 집계된 테스트의 범위를 밝히지 않는다. 이러한 세부 사항은 중요하다. 출시는 주요 파운데이션 모델, 파인튜닝된 변형 모델, 애플리케이션용 모델 또는 다른 유형의 업데이트를 의미할 수 있으며, ‘공개된 안전성 테스트’는 공식 평가 보고서부터 제한적인 모델 카드까지 다양할 수 있다.
이러한 유보사항을 감안하더라도 3.6%라는 수치는 민감한 업무 흐름에 모델을 배포할 수 있는지 판단하는 팀에 중요하다. 공개 문서는 외부 사용자가 데이터와 비용, 운영상의 책임을 모델에 맡기기 전에 모델의 알려진 실패 방식, 테스트 범위와 한계를 평가할 수 있는 몇 안 되는 방법 중 하나다.
제공된 세 출처는 같은 뉴스 제목을 싣고 있으며, 서로 독립적인 세 건의 조사라기보다 통신사 보도의 별도 버전으로 보인다. 이 묶음에서 주요 통신사로 명시된 곳은 Reuters이며, The Economic Times와 marketscreener.com은 같은 조사 결과를 재게재하거나 소개했다. 세 출처의 일치는 보도된 통계가 존재한다는 점을 뒷받침하지만, underlying methodology를 독립적으로 검증하지는 않는다.
현재 이용 가능한 증거는 중국 모델의 96.4%가 한 번도 테스트되지 않았다는 사실을 입증하지 않는다. 해당 출시물에 대해 안전성 테스트가 공개되지 않았다는 의미이며, 이는 다른 주장이다. 개발업체는 결과를 공개하지 않은 채 내부 평가를 진행할 수 있고, 보고서에 포착되지 않은 형식으로 정보를 공개할 수도 있다. 또는 대중이 아니라 고객과 당국에 테스트 결과를 제공할 수도 있다.
이 구분은 조달에서 중요하다. 공개된 증거가 없다고 해서 모델이 안전하지 않다는 뜻은 아니다. 그러나 독립 연구자와 구매자가 개발업체의 주장을 검증할 수 있는 능력은 제한된다. 따라서 이 통계는 모델 위험을 직접 측정한 수치가 아니라 투명성의 지표로 봐야 한다.
AI 개발자와 제품팀에게 안전성 테스트는 정의된 배포 맥락과 연결될 때만 유용하다. 범용 모델은 고객 서비스 비서로는 무난하게 작동할 수 있지만 의료 조언, 금융 의사결정, 코드 생성 또는 내부 시스템 접근에 사용되면 심각한 위험을 초래하는 방식으로 실패할 수 있다.
공개된 평가는 팀이 정확도 이상의 기준으로 모델을 비교하는 데 도움을 줄 수 있다. 시스템이 유해한 요청, 민감한 정보, 프롬프트 조작, 환각, 편향 또는 도구 사용을 어떻게 처리하는지 보여줄 수 있다. 또한 개발업체가 실제 운영 환경에서 나타날 가능성이 높은 적대적 입력에 대해 모델을 테스트했는지도 확인할 수 있다.
보고된 공개 비율은 많은 구매자가 비공개 문서, 공급업체의 보증 또는 자체 테스트에 의존해야 할 수 있음을 시사한다. 이는 비용과 책임을 downstream으로 넘긴다. 모델을 제품에 통합하는 스타트업은 평가 프로그램을 처음부터 구축해야 할 수 있고, 대기업은 계약상 약정, 감사 접근권, 모델 변경에 따른 반복 테스트를 요구할 수 있다.
당장의 의미는 중국 AI 모델을 검토 대상에서 제외해야 한다는 것이 아니다. 오히려 구매자는 고영향 업무 흐름에 배치하기 전에 더 강력한 증거 요건을 요구해야 할 수 있다. 여기에는 모델 카드, 버전별 평가 결과, 사고 보고, 레드팀 요약, 테스트하지 않은 항목에 대한 명확한 설명이 포함될 수 있다.
모델 개발업체 역시 실질적인 상충관계에 직면한다. 상세한 안전성 결과를 공개하면 약점이 드러나거나 감시가 강화될 수 있지만, 고객이 신뢰를 판단할 근거를 제공하고 시장 전체의 중복 테스트를 줄일 수 있다. 국제적으로 경쟁하는 개발업체에게 투명한 보고는 선택적인 커뮤니케이션 활동이 아니라 제품의 일부가 될 수 있다.
개발자 입장에서 3.6%라는 결과는 독립적인 평가의 필요성을 강조한다. 팀은 사용하려는 정확한 모델 버전을 애플리케이션에 존재하는 프롬프트, 도구, 검색 시스템, 권한 조건에서 테스트해야 한다. 공개 벤치마크는 배포 환경에 특화된 테스트를 대체할 수 없으며, 공개 테스트가 부족하면 분석을 중단할 것이 아니라 검증 수준을 높여야 한다.
이 문제는 규제기관과 플랫폼 운영자에게도 중요하다. 모델 출시가 잦고 안전성 문서가 일관되지 않다면 공개 출시 발표만을 바탕으로 한 감독은 시장을 불완전하게 파악할 수밖에 없다. 규제기관은 공개 의무를 더 면밀히 살필 수 있으며, 클라우드 및 애플리케이션 플랫폼은 기업 고객에게 제공하는 모델에 자체 문서 요건을 도입할 수 있다.
가장 먼저 살펴볼 신호는 원 보고서 자체다. 작성자, 데이터셋, 기간, 공개된 안전성 테스트를 집계한 기준을 확인해야 한다. 이러한 정보가 없으면 3.6%라는 수치를 다른 국가의 개발업체나 이전 기간과 신뢰성 있게 비교할 수 없다.
다음으로는 주요 중국 모델 개발업체가 새 출시물에 대해 표준화된 평가를 공개하기 시작하는지 여부다. 유용한 공개에는 모델 버전, 테스트 설계, 한계, 알려진 실패 사례, 평가 날짜가 포함되어야 한다. 한 번의 안전성 발표보다 버전별 반복 보고가 더 많은 정보를 제공할 것이다.
기업 구매자는 클라우드 제공업체와 대형 소프트웨어 플랫폼의 조달 요건도 지켜봐야 한다. 이러한 중개업체가 모델을 등록하거나 통합하기 전에 안전성 문서를 요구하기 시작하면 규제가 불명확한 상황에서도 투명성이 상업적 요건이 될 수 있다.
마지막으로 연구자들은 공개 테스트가 더 나은 운영 결과와 상관관계가 있는지 증거를 찾아야 한다. 보고서가 많아지는 것만으로 모델이 더 안전하다는 사실이 입증되지는 않는다. 공개 문서의 수보다 평가의 품질, 독립성, 관련성이 더 중요하다.
보고된 3.6%라는 비율은 모든 중국 AI 모델에 대한 판정이 아니라 가시성에 대한 경고로 이해하는 것이 가장 적절하다. 이용 가능한 보도는 보고서의 방법론을 제시하지 않으므로, 독자는 이 수치를 개발업체의 역량이나 모델 안전성을 완전히 측정하는 지표로 받아들여서는 안 된다.
중요한 점은 AI 도입자에게 부과되는 의사결정 부담이다. 공개 테스트가 드물다면 제품팀은 더 강력한 내부 평가, 더 엄격한 배포 통제, 문서화된 모니터링으로 이를 보완해야 한다. 시장에서는 유능한 모델뿐 아니라 모델이 어디에서 작동하고 어디에서 실패하는지 반복 가능한 증거를 제시할 수 있는 개발업체가 점점 더 경쟁 우위를 얻을 수 있다.