Y Combinator의 Garry Tan, 미국 오픈웨이트 연구소에 프런티어 모델 증류 허용 촉구

Y Combinator CEO Garry Tan은 미국에서 오픈웨이트 연구소가 프런티어 모델을 증류할 수 있도록 하는 체제를 지지하며, 제한에 도전하고 정책적 질문을 제기하고 있다.

AI News

Y Combinator CEO Garry Tan은 미국의 오픈웨이트 AI 기업들이 독점적 프런티어 모델을 증류할 수 있어야 한다고 주장하며, 더 넓은 접근권이 있어야 첨단 AI가 단일 공급자에 의해 통제되는 것을 막을 수 있다고 말하고 있다.

Tan은 CNBC에 현재의 모델 증류 분쟁에 규제 당국이 개입하지 않는 편이 낫다고 말했다. 이후 TechCrunch에 그는 더 작은 미국 연구소들이 미국 프런티어 시스템에서 이 기법을 공개적으로 사용할 수 있어야 하며, 이를 통해 중국의 오픈웨이트 모델에 대한 더 많은 국내 대안을 만들 수 있다고 말했다.

이 입장은 실리콘밸리에서 가장 영향력 있는 스타트업 액셀러레이터 중 하나의 수장을, 고객이 자신의 시스템을 어떻게 사용하는지에 대해 더 엄격한 통제를 요구하는 일부 프런티어 모델 기업들의 주장과 맞서게 만든다. 또한 유료 모델 접근을 통해 얻은 지식을 독점적 산출물, 공공 인프라, 혹은 그 사이의 무언가로 봐야 하는지에 대한 더 넓은 논쟁도 열어 놓는다.

Tan이 제안하는 것

모델 증류는 일반적으로 더 큰 모델에 광범위하게 질의하고, 그 응답을 사용해 다른 시스템을 훈련하는 것을 의미한다. 이 과정은 더 작은 모델이 언어, 추론, 작업 수행의 패턴을 학습하도록 돕되, 더 큰 모델의 기반 가중치를 그대로 복제하지는 않는다. AI 연구소들은 증류를 정당한 훈련 및 평가 작업의 일부로 흔히 사용한다.

Tan의 제안은 미국 기업이 도난된 자격 증명을 사용하거나 고객을 사칭하자는 것이 아니다. TechCrunch는 그가 미국 연구소들이 속임수나 무단 계정이 아니라 일반적인 모델 접근을 사용해 프런티어 모델에 “정문으로” 접근할 수 있기를 원한다고 보도했다.

그의 주장은 두 가지다. 첫째, Tan은 프런티어 기업들이 자신들의 AI API를 통해 반환된 정보로 고객이 무엇을 할 수 있는지 지나치게 통제하고 있다고 본다. 둘째, 그는 독점적 AI 기업들 역시 저작권이 있는 자료를 포함해 대규모로 공개 접근 가능한 인간 지식을 흡수함으로써 시스템을 구축했으며, 그 자료의 소유자들이 반드시 허가를 준 것은 아니라고 주장한다.

Tan의 관점에서 보면, 오픈웨이트 AI 기업들이 상용 시스템으로부터 배울 수 있게 하는 것은 소수의 프런티어 AI 연구소에 집중된 연산 자원, 자본, 연구 인재의 집중에 대한 견제 장치가 될 수 있다. 그는 최악의 시나리오는 한 회사가 압도적인 우위를 확보해 “단일체적(monolithic)” 공급자가 되는 것이라고 말했다.

증류가 논쟁적인 이유

이번 발언은 Anthropic이 중국 AI 기업들이 이른바 “불법 증류 공격”을 수행했다고 주장하는 두 번째 보고서를 발표한 뒤 나왔다. TechCrunch가 설명한 보고서에 따르면, 해당 기업들은 신원을 숨기고 사기를 사용했으며 도난된 자격 증명에 의존해 다른 모델의 능력을 허가 없이 추출했다.

Anthropic CEO Dario Amodei는 이전에 미국 규제 당국이 이런 활동에 대응해야 한다고 촉구한 바 있다. 이 입장은 무단 증류를 API를 통해 모델을 제공하는 일반적인 결과가 아니라 보안 및 지적재산권 문제로 본다.

따라서 허용된 증류와 금지된 증류의 구분이 핵심이다. Tan은 Anthropic의 주장에 나온 자격 증명 절도와 기만을 지지하는 것이 아니다. 그는 미국 오픈웨이트 연구소들이 투명한 접근 조건 아래 유사한 훈련 작업을 수행할 합법적 경로를 가져야 한다고 주장하고 있다.

하지만 이 제안은 여전히 어려운 질문들을 남긴다. 모델 제공자는 고객이 출력을 생성하는 것은 허용하면서도 그 출력을 경쟁 시스템 훈련에 사용하는 것은 제한할 수 있다. 또한 체계적 추출을 막기 위해 기술적 제한, 모니터링, 또는 계약 조건을 둘 수도 있다. Tan의 발언은 이런 제한이 지금처럼 광범위하게 집행 가능해야 하는지에 의문을 제기하지만, 이를 대체할 법적 틀을 제시하지는 않는다.

주장에 대한 증거와 한계

핵심 뉴스는 CNBC에 대한 발언과 이후 출판물에 대한 후속 언급 뒤 TechCrunch가 보도한 Tan의 공개 정책 입장이다. 제공된 보도에는 미국 정부가 “미국식 증류 체제”를 준비하고 있다거나 Tan의 제안이 Y Combinator의 공식 정책 플랫폼으로 채택되었다는 증거는 없다.

마찬가지로, 그 보도는 증류가 경쟁력 있는 오픈웨이트 모델을 안정적으로 만들어 내고, 훈련 비용을 낮추며, 중국 시스템에 대한 의존을 줄인다는 독립적 측정도 제시하지 않는다. 그러한 결과는 제안을 뒷받침하는 논거의 일부일 뿐, 이 기사에서 입증된 결과는 아니다.

Anthropic의 중국 연구소에 대한 주장 역시 회사 자체 보고서에 근거한 주장으로 제시된다. 제공된 자료에는 독립적인 조사나 지목된 기업들의 답변이 포함되어 있지 않다. 이는 같은 기술적 활동이라도 허가 여부, 계약 조건, 질의 규모, 그리고 자격 증명이 합법적으로 확보되었는지에 따라 매우 다르게 보일 수 있기 때문이다.

개발자들에게 실질적인 교훈은 증류가 기술적으로는 확립되어 있지만 정치적으로는 아직 정리되지 않았다는 점이다. 모델 개발자들은 허가된 환경에서 이 방법을 사용할 수 있지만, 접근 계약과 제공자 정책이 특정 훈련 워크플로가 허용되는지 여부를 결정할 수 있다.

개발자와 기업에 대한 시사점

Tan의 견해가 정책적 지지를 얻는다면, 더 작은 미국 연구소들은 오픈웨이트 모델을 개선하는 더 직접적인 경로를 얻을 수 있다. 공개 데이터셋과 내부 생성 예시에만 의존하지 않고, 프런티어 시스템을 합성 데이터 생성, 추론 시연, 평가, 또는 특화된 미세조정에 사용할 수 있을 것이다.

이는 모델 개발자 간 경쟁을 심화시키고, 로컬 배포, 가중치에 대한 더 큰 통제, 단일 호스팅 제공자에 대한 의존 감소가 필요할 때 제품 팀에 더 많은 선택지를 제공할 수 있다. 또한 라이선스가 부여된 교사 모델 접근과 세심하게 문서화된 증류 파이프라인을 둘러싼 새로운 상업 서비스도 만들어 낼 수 있다.

위험도 상당하다. 프런티어 기업들은 가격 인상, 대량 접근 제한, 더 강한 출력 필터 추가, 경쟁사 훈련처럼 보이는 계정 제한으로 대응할 수 있다. 더 공격적인 추출은 제공자가 독점적 능력을 보호하고 대형 모델 개발 비용을 회수하는 것을 더 어렵게 만들 수도 있다.

기업 구매자들은 관련된 거버넌스 문제에 직면하게 된다. 증류 모델을 사용하는 기업은 단지 벤치마크 성능만이 아니라, 훈련 데이터의 출처, 교사 모델 출력에 부여된 권한, 그리고 결과 시스템이 보호되거나 민감한 자료를 재현할 가능성도 이해해야 한다. 규제 환경에서는 이런 질문들이 모델 품질만큼 중요할 수 있다.

이 논쟁은 AI 안전성에도 닿아 있다. 오픈웨이트 배포는 감사 가능성과 사용자 통제력을 높일 수 있지만, 중앙 제공자의 모니터링이나 거부 시스템 없이 강력한 기능을 더 쉽게 배포하게 만들 수 있다. Tan의 경쟁 논리는 집중 위험을 다루지만, 그것만으로 오용, 프라이버시, 책임성 문제를 해결하지는 못한다.

다음에 주목할 점

첫 번째 신호는 미국 정책 입안자들이 Anthropic이 주장한 은밀한 활동과 허가된 증류를 구분할지, 아니면 모든 모델 간 훈련을 하나의 범주로 취급할지 여부다. AI API, 합성 데이터, 모델 출력 소유권에 관한 어떤 제안 규칙도 Tan의 아이디어가 탄력을 받는지 보여줄 것이다.

시장은 또한 프런티어 제공자들이 대량 질의, 모델 모방, 경쟁사 훈련을 규율하는 조건을 수정할지 지켜봐야 한다. 새로운 라이선스 프로그램은 명시적 계약 아래 증류를 허용하면서도 접근과 귀속에 대한 제공자의 통제를 유지하는 중간 해법이 될 수 있다.

기술 측면에서는 독립적인 평가가 중요하다. 증류 모델이 프런티어 시스템과 비슷하거나 근접할 수 있다는 주장은 일부 벤치마크 과제만이 아니라 신뢰성, 안전성, 사실성, 비용 전반에서 검증되어야 한다. 미국 오픈웨이트 연구소의 실제 채택 사례도 국가 경쟁력에 대한 일반론보다 더 강한 증거가 될 것이다.

Creati.ai 관점

Tan의 제안은 증류를 둘러싼 지적재산권이나 보안 문제에 대한 확정된 답이라기보다 경쟁 논리로 이해하는 것이 가장 좋다. 그는 프런티어 제공자가 부과하는 제한이 많은 정책 입안자들이 피하려는 바로 그 권력 집중을 강화할 수 있다고 경고한다.

하지만 개방적인 체제에는 명확한 경계가 필요하다. 허가된 접근, 투명한 훈련 기록, 집행 가능한 보호 장치는 더 건강한 모델 생태계를 지원할 수 있다. 반면 사기나 무차별 추출을 용인하면 프런티어 연구를 뒷받침하는 상업적 유인을 훼손할 위험이 있다. AI 개발자와 기업 구매자에게 당면한 문제는 증류가 존재하는지 여부보다, 제공자와 규제 당국, 법원이 언제 그것이 정당한지 정의할 수 있는지에 있다.

광고