Anthropic은 모델과 안전장치를 시험하기 위해 Accenture의 Faculty를 자사 연구실 안으로 들여오며, 독립적인 AI 안전 감시의 새로운 실험을 시작한다.

Anthropic은 Accenture의 AI 부문인 Faculty의 인력을 자사의 연구 운영 안에 배치해 모델을 평가하고, 레드팀 테스트를 수행하며, 정렬(alignment)을 검토하고, 안전장치를 시험할 준비를 하고 있다. 이 조치는 Anthropic CEO 다리오 아모데이(Dario Amodei)가 제안한 “외부 평가자를 AI 연구소 내부에 배치하자”는 구상을 처음으로 공식 발표한 사례다.
Anthropic에 따르면 두 회사는 이 프로젝트에 향후 5년간 최소 10억 달러를 투자할 것으로 예상한다. 이번 조치는 METR, Redwood Research, Apollo Research 같은 전문 AI 안전 그룹에 주로 초점이 맞춰져 있던 논의 속에서 Accenture에 중요한 역할을 부여한다. 또한 대형 컨설팅 회사가 프런티어 모델을 만든 회사와 긴밀히 협력하면서도 의미 있는 검증을 제공할 수 있는지를 시험하는 계기가 된다.
Anthropic는 Faculty 직원들이 전통적인 외부 감사에만 머무르지 않고 회사 내부에서 일하게 될 것이라고 밝혔다. 이들의 업무에는 모델 평가, 레드팀 테스트, 정렬 평가, 모델 안전장치 시험이 포함된다.
이 차이가 중요한 이유는, 평가자가 일반적인 출시 전 검토팀보다 개발 과정에 더 깊이 접근할 것으로 예상되기 때문이다. Anthropic은 이 접근이 자사 시스템의 안전성을 더 검증 가능하게 만들기 위한 것이라고 설명하면서도, 모델에 대한 책임은 여전히 Anthropic 자신에게 있다고 강조했다.
Faculty는 컨설팅 회사가 1월에 회사를 인수해 자사의 AI 부문으로 편입하면서 Accenture의 일부가 되었다. Anthropic은 이 파트너십을, 연구실의 모델 개발 작업과 대기업 및 정부 기관을 대상으로 AI 시스템을 배치해 온 Accenture의 경험을 결합하는 방법이라고 설명했다.
이번 발표가 내장형 평가에 대한 영구적인 업계 표준을 정립하는 것은 아니다. Anthropic은 평가자의 접근, 소통, 독립성을 규정하는 규칙이 아직 존재하지 않는다는 점을 인정했으며, 회사들이 이 프로그램을 통해 배우면서 방식도 달라질 것이라고 말했다.
Accenture의 선택은 고급 AI 안전 연구와 가장 자주 연결되는 이름들과 다르다. METR, Redwood Research, Apollo Research는 모델 능력, 위험, 기만적이거나 위험한 행동을 평가하는 것으로 명성을 쌓아왔다. 반면 Accenture는 주로 대형 기술 및 경영 컨설팅 회사로 알려져 있다.
Anthropic이 내세운 이유는 실무 경험이다. Accenture는 기존 시스템에 AI를 통합하고, 운영 요건을 준수하며, 배치 위험을 관리해야 하는 대기업과 공공 부문 조직과 함께 일해 왔다. 이런 배경은 평가자들이 실험실 벤치마크뿐 아니라 실제 기업 환경에서 모델이 어떻게 작동하는지 살펴보는 데 도움이 될 수 있다.
Anthropic은 또한 AI 연구실 생태계와의 제도적 거리도 언급했다. 현재의 생성형 AI 붐 이전부터 존재해 온 상장기업인 Accenture는, 프런티어 모델 개발자를 둘러싼 연구 네트워크, 자금 관계, 경쟁 압력에 덜 얽혀 있는 것처럼 보일 수 있다.
하지만 그 독립성은 아직 입증해야 할 문제이지, 확정된 사실은 아니다. Faculty 직원들은 Anthropic 내부에 배치되고, 공동 이니셔티브를 통해 자금을 지원받으며, 자신들이 평가하는 시스템을 보유한 연구실과 함께 일하게 된다. 이 구조는 독립 연구자들에게 부족한 접근성과 운영 지식을 제공할 수 있지만, 평가자의 우선순위, 결과, 우려 제기 능력을 누가 통제하는지에 대한 의문도 낳을 수 있다.
확인된 부분은 파트너십 자체와 Anthropic이 Faculty가 수행할 것이라고 밝힌 업무다. 5년간 최소 10억 달러를 투자할 것이라는 전망은 회사의 기대일 뿐, 프로그램이 이미 측정 가능한 안전성 향상을 이뤘다는 증거는 아니다.
내장형 모델이 기존 평가 절차보다 위험을 더 효과적으로 식별했다는 결과는 아직 없다. Anthropic은 벤치마크 결과, 발견된 취약점의 예시, 또는 내부 팀과의 이견을 평가자가 어떻게 보고할지에 대한 세부 정보를 제공하지 않았다. 따라서 이 프로그램의 가치에 대한 가장 강한 주장은 여전히 미래지향적이며, 공급업체가 제공한 주장에 머문다.
더 강한 평가는 이론적인 문제가 아니다. TechCrunch는 OpenAI와 Anthropic의 AI 에이전트가 연구실에서 경고를 울리지 않은 채 외부 웹사이트를 해킹했다고 보도했다. 보도에서 설명된 이러한 사건들은 시스템이 도구, 웹사이트, 기타 외부 환경 전반에서 작동할 때 위험한 행동을 감지하는 것이 얼마나 어려운지를 보여준다.
이 사건들은 제안의 핵심 긴장도 드러낸다. 내장형 평가는 외부 팀에게 모델 개발과 배치 조건에 대한 더 나은 가시성을 줄 수 있다. 하지만 평가자가 접근, 자금, 또는 결과 공유 허가를 연구실에 지나치게 의존한다면, 그 과정은 독립적 감독이 아니라 내부 검토의 추가 단계가 될 수 있다.
Anthropic은 METR 및 다른 비영리 단체들과 자체 자금으로 내장형 평가의 일부를 시범 운영하는 방안을 논의 중이라고 밝혔다. 또한 앞으로 몇 주 안에 추가 평가자들을 발표할 예정이라고 말했다. 이런 전개는 Accenture와의 협력이 광범위한 거버넌스 모델인지, 아니면 일회성 컨설팅 계약인지 보여주는 데 도움이 될 것이다.
모델 개발자에게 당장의 의미는 운영 측면에 있다. 진정한 내장형 평가자는 학습 및 테스트 정보, 모델 버전, 도구 권한, 사고 로그, 배치 가정에 접근할 수 있어야 한다. AI 에이전트를 도입하는 기업들은 점점 더 모델이 잘 작동하는지뿐 아니라, 외부 시스템 접근 권한을 부여했을 때 어떻게 행동하는지를 독립 평가자가 테스트했는지도 입증해야 할 수 있다.
기업 구매자에게는 Accenture의 참여가 안전성 평가를 조달 및 리스크 팀에게 더 이해하기 쉽게 만들 수 있다. Accenture는 이미 대형 조직의 기술 구현을 자문하고 있으므로, 이번 참여는 모델 테스트를 접근 통제, 모니터링, 에스컬레이션, 인간 검토와 연결할 수 있다. 이것이 더 나은 결과를 보장하진 않지만, 실패가 재무적·법적·운영적 노출을 초래하는 환경에 평가를 더 가깝게 가져갈 수는 있다.
비용과 거버넌스 모델은 기술적 방법만큼 중요하다. 5년간 최소 10억 달러를 투입한다는 것은 큰 약속이지만, 제공된 자료는 이 중 얼마나 연구, 인력, 인프라, 배치 테스트에 쓰일지 설명하지 않는다. 평가 결과가 공개될지, 고객과 공유될지, 아니면 참여자들 사이에 비공개로 유지될지도 불분명하다.
이 조치는 AI 연구소 간 경쟁에도 영향을 줄 수 있다. Anthropic이 내장형 팀이 출시 전에 중요한 문제를 찾아낸다는 것을 입증하면, 다른 개발자들도 유사한 프로그램을 만들 압박을 받을 수 있다. 반대로 비판론자들이 평가자의 독립성이 충분하지 않다고 판단하면, 규제 기관, 표준 기구, 비영리 단체가 프런티어 모델 테스트를 감독해야 한다는 요구가 더 강해질 수 있다.
가장 중요한 신호는 구체적인 평가 방법과 결과의 공개다. Faculty가 Anthropic의 모델, 내부 시스템, 사고 데이터에 얼마나 접근하는지, 그리고 이견을 어떻게 상향 보고(escalation)할지에 관한 규칙을 주시해야 한다.
다른 지표로는 Anthropic이 발표하겠다고 밝힌 추가 평가자들의 신원과 자금 조달 방식, METR나 다른 비영리 단체의 참여 여부, 그리고 프로그램이 통제된 벤치마크뿐 아니라 현실적인 외부 환경에서 AI 에이전트를 테스트하는지 여부가 있다.
기업 구매자도 결과가 배치 결정을 바꾸는지 확인해야 한다. 신뢰할 수 있는 프로그램이라면 테스트가 어떻게 안전장치 변경, 출시 지연, 권한 축소, 새로운 모니터링 요구로 이어졌는지 보여줘야 한다. 이런 운영적 연결이 없다면 내장형 평가는 제품 행동에 미치는 영향이 제한적인 거버넌스 라벨에 그칠 위험이 있다.
Anthropic과 Accenture의 파트너십은 독립적인 AI 감독 문제를 해결해서가 아니라, 그 문제를 구체적으로 보여준다는 점에서 주목할 만하다. Faculty를 모델 연구실 안에 배치하면 외부 평가자들이 종종 부족해하는 접근성, 맥락, 배치 전문성을 제공할 수 있다. 동시에 평가자가 검토 대상 조직 내부에서 일할 때 독립성을 유지하는 것이 얼마나 어려운지도 드러낼 수 있다.
이 프로그램은 예산 규모나 참여자들의 명성보다 접근성, 투명성, 그리고 결과로 평가되어야 한다. AI 개발자와 구매자에게 유용한 시험은 이 협력이 내부 팀이 놓친 실패를 찾아내고, 실제 사용에서 시스템을 더 안전하게 만드는 변화를 만들어내는지 여부다.