AI News

Anthropic은 Claude가 생성한 텍스트에 워터마크를 적용하려는 계획에 대해 더 자세한 내용을 공개하며, 독자에게는 눈에 띄는 변화 없이 AI가 작성한 자료를 식별하도록 설계된 시스템이라고 설명했다. 회사는 올바른 암호 키가 있으면 이 워터마크를 감지할 수 있으며, 별도의 워터마크 탐지 API도 제공할 계획이라고 밝혔다.

이번 설명은 Anthropic이 이번 주 초, Claude가 유럽연합 AI법 투명성 강령을 준수하기 위해 워터마킹을 도입할 것이라고 밝힌 뒤 나왔다. 이 조치는 고용주, 학교 또는 다른 기관이 이 기술을 사용해 공개되지 않은 Claude 사용을 식별할 수 있다는 우려를 가진 사용자들 사이에서 논쟁을 불러일으켰다.

Claude의 워터마크는 어떻게 작동하도록 설계됐나

금요일에 게시된 블로그 글에서 Anthropic은 Claude가 Google DeepMind가 개발하고 2024년에 소개한 SynthID-Text 방식을 사용할 것이라고 밝혔다. 이 방법은 언어 모델이 여러 단어나 문구가 똑같이 잘 맞을 때 어떤 선택을 하는지에 의존한다. 예를 들어, 모델은 날씨를 설명하는 여러 가지 타당한 방법을 가질 수 있다. 응답 전반에 걸쳐 이러한 선택은 일반 독자에게는 드러나지 않지만, 관련 탐지 키를 가진 사람이 확인할 수 있는 통계적 패턴을 형성할 수 있다.

Anthropic은 워터마크가 Claude의 출력 품질에 영향을 주어서는 안 된다고 말했다. 회사는 워터마크가 있는 응답을 독자에게는 워터마크가 없는 응답과 구별할 수 없다고 설명하며, 이는 일반적인 글쓰기나 코딩 작업 흐름에서 사용자가 이 시스템을 알아차릴 가능성이 낮다는 뜻이다.

계획된 탐지 API는 워터마크 자체보다 더 중요할 수 있다. 설명대로 출시된다면 개발자, 출판사, 교육자, 기업 관리자가 범용 AI 탐지 도구에만 의존하지 않고 자체 시스템에 검증 기능을 구축할 수 있게 된다.

편집, 교정, 그리고 전면 재작성

Anthropic은 워터마크가 텍스트의 모든 가능한 버전에서 영구적인 것은 아니라고 인정한다. 회사는 가벼운 편집으로는 완전히 지워지지 않을 가능성이 높지만, 모든 단어를 바꾸는 전면 재작성은 지워버릴 것이라고 말한다. 이런 차이는 이 시스템이 최종 문서가 모델과 어떤 관계가 있는지 증명하기보다는, 상당 부분 보존된 Claude 출력을 식별하는 데 더 유용하다는 뜻이다.

결과는 Claude를 편집기로 어떻게 사용하느냐에 따라서도 달라질 수 있다. 모델이 사람이 쓴 문장을 교정만 한다면, Anthropic은 대부분의 단어가 원저자에게서 왔기 때문에 워터마크가 붙을 텍스트가 거의 없을 수 있다고 말한다. 탐지는 해당 문장의 길이와 Claude가 얼마나 광범위하게 수정했는지에 달려 있다.

이 제한은 규정 준수 또는 출처 추적 워크플로를 구축하는 제품 팀에게 중요하다. 워터마크 결과가 양성이라면 Claude가 자료를 생성했거나 상당히 변경했다는 뜻일 수 있지만, 그 기반 아이디어를 누가 썼는지, 텍스트의 얼마나 많은 부분이 사람에게서 왔는지, 최종 버전이 나중에 다른 곳에서 다시 작성되었는지까지는 입증하지 못할 수 있다.

이 시스템이 코드에 의미하는 것

Anthropic은 워터마크가 일반 산문보다 코드에서 더 약할 것으로 예상한다. 실제로 동작하는 소프트웨어는 일반적으로 모델이 서로 바꿔 쓸 수 있는 단어나 구조 중에서 선택할 자유가 적어, 워터마크 패턴에 사용할 수 있는 임의적 결정의 수가 줄어든다.

회사는 특히 주석처럼 유연한 언어 선택이 포함된 코드에서는 여전히 감지 가능한 신호가 나타날 수 있다고 말한다. 실행 가능한 코드에 대한 영향은 정의상 미미하다고 설명하며, 워터마크는 주로 코드 생성에 대한 제약이 아니라 출처 확인 메커니즘으로 의도된 것임을 시사한다.

엔지니어링 조직 입장에서는 이런 차이가 워터마킹을 프로그램의 기능적 동작보다 문서화, 주석, 커밋 메시지, 생성된 설명에 더 중요하게 만들 수 있다. 또한 짧은 코드 조각이나 매우 제약된 코드에서는 긴 자연어 응답보다 탐지 결과가 덜 신뢰할 수 있음을 의미한다.

Anthropic 주장 뒤의 근거

현재의 세부 사항은 Anthropic이 계획된 구현에 대해 직접 설명한 내용에서 나온 것이다. 출력 품질이 변하지 않고, 가벼운 편집에 견디며, 코드에 미치는 영향이 제한적이라는 회사의 주장은 공급사 측 주장이다. 원문 자료에는 독립적인 테스트 결과, 탐지 정확도 수치, 오탐률, 워터마크 탐지 API의 출시일이 제공되지 않는다.

기술적 기반이 Anthropic만의 독창적인 것은 아니다. Anthropic은 자사가 사용할 방법으로 Google DeepMind의 워터마킹 접근법인 SynthID-Text를 꼽았다. 회사는 또한 다른 주요 모델 개발사들도 같은 실천 강령에 서명했고 자체 워터마크를 구현할 계획이라고 말하지만, 원문은 그 개발사들이 누구인지 밝히지 않으며 시스템이 상호 운용 가능한지도 설명하지 않는다.

이는 문체 신호나 반복되는 글쓰기 패턴을 살펴보는 AI 탐지 제품과는 다르다. Anthropic은 워터마크 검증을 텍스트의 특성으로 AI 사용을 추정하려는 Pangram 같은 서비스와 명확히 구분한다. 워터마크 검사는 모델이 만든 신호를 찾고, 스타일 기반 탐지기는 글 자체로부터 확률적 판단을 내린다.

사용자들의 반발은 이 배포에 시장과 정책 차원을 더했다. TechCrunch는 Reddit 사용자들이 이 조치를 비판했다고 보도했고, Business Insider는 X의 수십 명이 Claude 구독을 취소했다고 주장했다고 보도했다. 이런 반응은 보도된 사용자 진술일 뿐, Anthropic 고객 기반의 측정된 변화를 보여주는 증거는 아니다.

개발자와 기업 구매자에게 주는 의미

AI 개발자에게 이번 발표는 출처 확인이 별도의 모더레이션 또는 탐지 계층이 아니라 API 수준의 기능이 될 것임을 시사한다. 보고서, 마케팅 문구, 지원 응답, 내부 문서를 생성하는 애플리케이션은 결국 자신이 생성한 콘텐츠에 기계 판독 가능한 검증을 첨부할 수 있게 될지도 모른다.

기업 구매자는 워터마크가 무엇을 정당하게 증명할 수 있는지 판단해야 한다. 워터마크는 Claude 출력에 가까운 콘텐츠를 식별하는 데 도움이 될 수 있지만, 공동 저작 사례, 크게 편집된 문서, 여러 도구를 거쳐 복사된 자료의 문제를 해결하지는 못한다. 채용, 교육, 규정 준수 결정에 워터마크를 사용하는 조직은 불확실한 결과와 가능한 위음성에 대한 정책이 필요하다.

이 접근 방식은 배포 측면에서의 절충도 만든다. 워터마킹은 모든 응답에 눈에 보이는 라벨을 노출하지 않고도 투명성 요구를 지원할 수 있지만, 검증은 올바른 탐지 시스템에 접근할 수 있어야 가능하다. Anthropic이 API를 공개하고 독립 평가가 이루어질 때까지 개발자는 지연 시간, 비용, 신뢰성, 타사 콘텐츠 관리 시스템과의 호환성을 판단할 수 없다.

다음에 주목할 점

첫 번째 신호는 Anthropic의 워터마크 탐지 API 공개로, 문서, 접근 제어, 가격, 지원 콘텐츠 유형이 포함될 것이다. 이후 독립 테스트에서는 짧고 긴 응답, 패러프레이징, 번역, 교정, 적대적 재작성 전반의 탐지율을 살펴봐야 한다.

개발자들은 Anthropic이 사람과 AI가 섞인 텍스트에 대한 정책 지침을 공개하는지, 그리고 코드, 주석, 문서를 어떻게 다루는지도 지켜봐야 한다. 또 다른 미해결 질문은 서로 다른 모델 제공사의 워터마크를 일관되게 인식할 수 있는지, 아니면 각 회사 구현에 종속되는지이다.

마지막으로 EU의 투명성 강령과 그 실제 집행이 워터마킹을 주요 모델 제공사의 기본 요건으로 만들지, 아니면 더 넓은 공개 체계의 한 구성 요소로 남게 할지를 결정할 것이다.

Creati.ai 관점

Anthropic의 설명은 Claude의 워터마킹을 눈에 보이는 라벨이라기보다 숨겨진 출처 신호처럼 들리게 만든다. 이는 대규모 검증에 유용할 수 있지만, 탐지 도구가 정확하고 접근 가능하며, 이를 저자 확정 증거가 아니라 모델 관여의 증거로 해석할 때에만 그렇다.

가장 중요한 시험은 API가 제공된 뒤에 올 것이다. 독립적인 결과가 일반적인 편집과 실제 생산 워크플로에서 워터마크가 어떻게 작동하는지 보여주기 전까지, 기업은 이를 거버넌스를 위한 진화 중인 신호로 취급해야지, 단독 규정 준수 판정으로 취급해서는 안 된다.

추천

Anthropic, Claude의 텍스트 워터마크가 어떻게 작동하는지 설명

Anthropic은 Claude의 워터마크가 AI 작성 텍스트를 어떻게 식별하는지, 어떤 편집이 이를 무력화할 수 있는지, 그리고 개발자가 무엇을 기대해야 하는지 설명하고 있다.