Base Labs, Hugging Face 및 Goodfire와 오픈웨이트 AI 안전 인프라 구축 협력

Base Labs, Hugging Face, Goodfire는 모델 위험이 커지는 가운데, 안전장치를 더 투명하게 만들기 위해 오픈웨이트 AI 안전 인프라를 구축하고 있다.

AI News

AI 추론 기업 Baseten이 만든 연구 그룹 Base Labs가 Hugging Face 및 Goodfire AI와 협력해 오픈웨이트 모델을 위한 안전 인프라를 개발하고 있다. 이번 이니셔티브는 안전 평가와 모니터링을 나중에 별도로 덧붙이는 층이 아니라 모델 개발 및 배포 과정의 일부로 만드는 것을 목표로 한다.

이번 발표는 개발자와 정책 입안자들이 가중치를 다운로드하고 수정하며 내장된 안전장치를 제거할 수 있는 모델을 어떻게 관리할지 논의하는 가운데 나왔다. AI 빌더와 기업 팀에게 이 파트너십은 소수의 모델 제공업체에 의한 중앙집중식 통제에 의존하지 않고도 오픈 모델 생태계가 신뢰할 만한 안전 관행을 확립할 수 있는지 시험하는 초기 검증 사례가 될 수 있다.

오픈 모델 안전을 위한 3사 접근법

Base Labs는 오픈 모델의 학습 및 모니터링 방법을 개발하고 공개할 것이라고 밝히며, 장기적으로는 오픈웨이트 생태계를 위한 투명한 안전 “표준”을 만드는 것을 목표로 한다. 오픈소스 및 오픈웨이트 모델의 주요 호스팅 플랫폼인 Hugging Face가 이 노력에 참여하고 있으며, Goodfire AI는 모델 해석성 분야의 전문성을 제공한다.

기업들은 파트너십의 기술 설계를 공개하지 않았다. 따라서 이 작업이 평가 벤치마크, 배포 도구, 학습 방법, 모니터링 시스템 또는 이들의 조합을 만들어낼지에 대한 기본적인 질문이 남아 있다.

모델 행동을 더 이해하기 쉽게 만들겠다는 Goodfire의 공언된 초점은 해석성이 제안된 프레임워크의 일부가 될 수 있음을 시사한다. Baseten의 발표에 대한 응답에서 Goodfire는 안전은 오픈 모델에 내장되어야 하며 이를 서비스하는 조직이 제공해야 한다고 말했다. 이는 폭넓은 목표이지, 아직 공개된 명세는 아니다.

Baseten은 2026년 초 Base Labs를 연구 부문으로 출범시켰다. 또한 회사는 개발자와 다른 연구 커뮤니티 구성원들에게 프레임워크에 기여해 달라고 요청했으며, 이는 이 프로젝트가 세 창립 파트너를 넘어 확장되길 원한다는 뜻이다.

오픈웨이트 모델이 논쟁의 중심에 있는 이유

직접적인 배경에는 다운로드 가능한 모델에서 안전장치가 제거될 수 있다는 우려가 커지고 있다는 점이 있다. TechCrunch는 “abliteration”이라 불리는 기법이 거부 응답 및 기타 안전 제어를 비활성화하거나 약화하는 데 점점 더 사용되고 있다고 보도했다. 보고서에 따르면 Hugging Face에는 현재 abliterated로 식별된 모델이 6,000개 이상 등록되어 있다.

이 수치는 전체 오픈 모델 시장의 독립적인 측정치가 아니라 플랫폼 카탈로그의 내용과 라벨링을 반영한 것이다. 그럼에도 불구하고 가중치가 공개된 이후 모델의 원래 안전 행동을 영구적인 것으로 취급하는 것이 실무적으로 얼마나 어려운지 보여준다.

모델 개발자에게 이 문제는 안전 질문을, 공급자가 가드레일을 추가했는지 여부에서, 그 가드레일이 재배포나 수정 이후에도 의미를 유지하는지 여부로 바꾼다. 모니터링 도구는 하위 사용자가 변경한 프롬프트, 파인튜닝, 양자화 또는 기타 변경 아래에서 모델이 어떻게 작동하는지도 평가해야 할 수 있다.

Base Labs는 외부인이 모델 행동을 검사하고 더 투명한 제어를 개발할 수 있기 때문에 개방성이 안전 연구에 도움이 된다고 주장한다. 이는 회사의 입장이며, 이번 파트너십으로 입증된 결론은 아니다. 개방형 접근은 감시를 개선할 수 있지만, 보호 장치를 제거하거나 안전하지 않은 변형을 재현하기도 더 쉽게 만들 수 있다.

무엇이 입증되었고, 무엇이 입증되지 않았는가

확인된 발표는 파트너십의 형성과 안전 방법을 구축하고 공개하겠다는 회사들의 의도에 한정된다. 제공된 보도에는 기술 아키텍처, 출시 일정, 평가 결과, 모델 목록, 거버넌스 절차가 제시되지 않았다.

가장 구체적인 시장 신호는 TechCrunch가 보도한 6,000개 이상의 abliterated 모델을 보유한 Hugging Face 카탈로그다. 이 카탈로그는 개방형 배포 네트워크 전반에서 안전 속성을 유지하려는 어떤 노력도 직면하게 되는 도전의 규모를 보여주지만, 그 모델들 중 얼마나 많은 수가 널리 사용되며 측정 가능한 실제 위험을 초래하는지는 보여주지 않는다.

참여자들의 재무 여력도 맥락을 제공하지만 기술적 진전을 증명하지는 않는다. Baseten은 6월에 시리즈 F 투자로 15억 달러를 조달해, 보도상 기업가치 130억 달러에 도달했다. Goodfire AI는 올해 초 B Capital 주도로 시리즈 B에서 1억 5,000만 달러를 조달했다. 이 수치들은 프로젝트가 엔지니어링 및 연구 역량에 접근할 수 있게 할 수 있지만, 제안된 표준이나 그 채택 가능성을 검증하지는 않는다.

이용 가능한 세부 사항이 주로 회사의 발표와 언론 보도에서 나오기 때문에, 투명성, 생태계 참여, 향후 안전 개선에 관한 주장은 발표된 목표로 받아들여야 한다. 이 접근법이 유해한 출력을 줄이거나 모델 수정 후에도 살아남는다는 것을 보여주는 독립적인 벤치마크 결과는 아직 없다.

이 파트너십이 빌더와 기업에 의미할 수 있는 것

Base Labs, Hugging Face, Goodfire가 실용적인 도구를 내놓는다면, 모델 제작자는 출시 전 행동 테스트와 배포 후 모델 모니터링을 위한 공통 프로세스를 얻을 수 있다. 이는 팀이 안전 평가를 문서화하고, 모델 버전을 비교하며, 파인튜닝이나 하위 배포로 인한 변경을 식별하는 데 도움이 될 수 있다.

기업 구매자에게 실질적인 가치는 이 프레임워크가 조달, 위험 검토, 규정 준수 워크플로에 맞는 증거를 만들어내는지에 달려 있다. 업데이트되거나 맞춤화되거나 서로 다른 공급자에 의해 호스팅되는 모델을 배포하는 조직에게는 모델 카드나 일회성 벤치마크만으로는 충분하지 않을 수 있다. 구매자는 재현 가능한 테스트, 감사 추적, 버전 추적, 그리고 파생 모델에 어떤 보호가 남아 있는지에 대한 명확한 정보를 필요로 할 가능성이 높다.

이 파트너십은 또한 Hugging Face를 잠재적으로 영향력 있는 위치에 놓는다. 주요 배포 및 발견 플랫폼으로서 개발자가 모델을 선택하는 시점에 안전 메타데이터와 평가 결과가 보이도록 하는 데 도움을 줄 수 있다. 그러나 호스팅 인프라만으로는 다운로드된 모델이 원래의 안전장치를 유지한다고 보장할 수 없다.

Base Labs와 Goodfire에게 이 프로젝트는 모델 추론, 해석성, 안전 도구가 점점 더 연결되는 시장에서 경쟁적 입지를 구축할 기회가 될 수도 있다. 회사들은 자금이 넉넉한 연구팀뿐 아니라 오픈소스 개발자에게도 실용적인 접근법임을 보여줘야 한다. 비싸고 느리거나 통합이 어려운 도구는 기술적으로 강력한 평가를 제공하더라도 채택을 제한할 수 있다.

다음에 주목할 점

첫 번째 신호는 공개 기술 릴리스가 될 것이다: 명세서, 벤치마크 세트, 학습 레시피, 모니터링 도구 또는 참조 구현이다. 그 범위는 이 파트너십이 주로 연구 프로그램인지, 아니면 생산 사용을 위한 운영 표준인지 보여줄 것이다.

개발자들은 또한 프레임워크 아래에서 테스트된 모델에 대한 독립 평가, 특히 파인튜닝이나 안전 제어 제거 이후의 평가를 주목해야 한다. 수정된 모델에서도 위험한 행동을 계속 감지할 수 있다는 증거는 출시 주장보다 훨씬 더 의미가 있다.

다른 중요한 신호로는 창립 그룹 외부 모델 제작자의 참여, Hugging Face 워크플로와의 통합, 문서화된 비용과 지연 시간, 그리고 새로운 공격 기법이 등장할 때 평가를 업데이트하는 절차가 있다. 거버넌스도 중요하다. 파트너들은 아직 누가 허용 가능한 행동을 정의하고, 분쟁을 해결하며, 프레임워크를 유지할지 설명하지 않았다.

Creati.ai 관점

이 파트너십은 오픈웨이트 AI의 실제 약점, 즉 모델을 복사하고 수정할 수 있게 되면 안전 제어를 유지하기 어렵다는 문제를 다룬다. 투명성과 공유 도구가 안전을 개선할 수 있다는 핵심 주장은 타당하지만, 다른 이들이 재현하고 검증할 수 있는 방법을 회사들이 공개하기 전까지는 입증되지 않은 상태다.

빌더와 기업 팀에게 이번 발표는 완성된 안전 솔루션이라기보다 인프라 제안으로 보는 것이 가장 적절하다. Base Labs, Hugging Face, Goodfire의 신뢰성은 파트너십 자체보다 오픈 평가, 측정 가능한 결과, 그리고 모델이 원래의 개발 환경을 떠난 뒤에도 계속 작동하는 제어를 제공할 수 있는지에 달려 있다.

광고