AI News

Anthropic предоставила больше подробностей о своем плане наносить водяные знаки на текст, сгенерированный Claude, описывая систему, предназначенную для идентификации материалов, написанных ИИ, без видимого изменения ответа для читателей. Компания заявляет, что водяной знак можно будет обнаружить с помощью правильного криптографического ключа, и планирует предложить отдельный API для обнаружения водяных знаков.

Это разъяснение последовало после того, как в начале недели Anthropic заявила, что Claude примет водяные знаки, чтобы соответствовать Кодексу прозрачности ЕС по AI Act. Этот шаг вызвал дискуссию среди пользователей, обеспокоенных тем, что работодатели, школы или другие учреждения смогут использовать технологию для выявления нераскрытого использования Claude.

Как устроены водяные знаки Claude

В блоге, опубликованном в пятницу, Anthropic заявила, что Claude будет использовать подход SynthID-Text, разработанный Google DeepMind и описанный в 2024 году. Метод основан на выборе, который делает языковая модель, когда несколько слов или фраз подходят одинаково хорошо. Например, модель может иметь несколько разумных способов описать погоду. В пределах одного ответа такие выборы могут формировать статистический паттерн, незаметный для обычного читателя, но проверяемый человеком с соответствующим ключом обнаружения.

Anthropic заявила, что водяной знак не должен влиять на качество вывода Claude. Компания описывает ответ с водяным знаком как неотличимый для читателя от ответа без него, что означает: пользователи, вероятно, не заметят систему в обычных рабочих процессах письма или кодирования.

Планируемый API обнаружения может оказаться важнее самого водяного знака. Если он будет выпущен в описанном виде, он даст разработчикам, издателям, преподавателям и корпоративным администраторам возможность встроить проверку в свои системы, а не полагаться только на универсальные инструменты обнаружения ИИ.

Редактирование, вычитка и полные переписывания

Anthropic признает, что водяной знак не является постоянным во всех возможных версиях текста. Компания говорит, что легкая правка, вероятно, не удалит его полностью, тогда как полное переписывание, заменяющее каждое слово, удалит. Такое различие делает систему более полезной для идентификации существенно сохраненного вывода Claude, чем для доказательства того, что финальный документ имеет какую-либо связь с моделью.

Результат также может зависеть от того, как Claude используется в роли редактора. Если модель лишь вычитывает написанный человеком фрагмент, Anthropic говорит, что текста, к которому можно «прицепить» водяной знак, может быть мало, потому что большинство слов пришло от исходного автора. Обнаружение будет зависеть от длины фрагмента и степени изменений, внесенных Claude.

Это ограничение важно для продуктовых команд, выстраивающих процессы комплаенса или происхождения контента. Положительный результат проверки водяного знака может указывать на то, что Claude сгенерировал материал или существенно его изменил, но он не обязательно докажет, кто написал исходные идеи, какая часть текста принадлежит человеку или был ли финальный вариант позже переписан в другом месте.

Что эта система означает для кода

Anthropic ожидает, что водяной знак будет слабее в коде, чем в обычной прозе. Рабочее программное обеспечение обычно оставляет модели меньше свободы выбора между взаимозаменяемыми словами или структурами, сокращая число произвольных решений, доступных для формирования паттерна водяного знака.

Компания заявляет, что некоторый обнаруживаемый сигнал все же может появляться там, где код содержит гибкие языковые выборы, особенно в комментариях. Влияние на исполняемый код она характеризует как незначительное по определению, что говорит о том, что водяной знак предназначен прежде всего как механизм происхождения, а не как ограничение на генерацию кода.

Для инженерных организаций такое различие может сделать водяные знаки более значимыми для документации, комментариев, сообщений коммитов и сгенерированных объяснений, чем для функционального поведения программы. Это также означает, что результат обнаружения может быть менее надежным для коротких фрагментов или сильно ограниченного кода, чем для более длинных ответов на естественном языке.

Что стоит за заявлениями Anthropic

Текущие подробности исходят из собственного объяснения Anthropic о планируемой реализации. Заявления компании о неизменном качестве вывода, устойчивости к легкому редактированию и ограниченном влиянии на код — это утверждения поставщика; исходный материал не содержит независимых результатов тестов, показателей точности обнаружения, частоты ложноположительных результатов или даты выпуска API обнаружения водяных знаков.

Техническая основа не является полностью уникальной для Anthropic. Anthropic называет SynthID-Text, подход Google DeepMind к водяным знакам, тем методом, который она собирается использовать. Компания также говорит, что другие крупные разработчики моделей подписали тот же Кодекс практики и планируют внедрить собственные водяные знаки, хотя источник не называет этих разработчиков и не описывает, будут ли их системы совместимы между собой.

Это отличается от продуктов обнаружения ИИ, которые анализируют стилистические сигналы или повторяющиеся паттерны письма. Anthropic специально отделяет проверку по водяному знаку от сервисов вроде Pangram, которые пытаются сделать вывод об использовании ИИ по характеристикам текста. Проверка водяного знака ищет сигнал, созданный моделью; детектор, основанный на стиле, делает вероятностное заключение на основе самого текста.

Сопротивление пользователей добавило к запуску рыночное и политическое измерение. TechCrunch сообщил, что пользователи на Reddit раскритиковали этот шаг, а Business Insider сообщил, что десятки людей в X заявили, что отменили подписку на Claude. Эти реакции — зафиксированные заявления пользователей, а не свидетельство измеренного изменения клиентской базы Anthropic.

Последствия для разработчиков и корпоративных покупателей

Для разработчиков ИИ это объявление указывает на то, что происхождение контента станет функцией на уровне API, а не отдельным слоем модерации или обнаружения. Приложения, генерирующие отчеты, маркетинговые тексты, ответы поддержки или внутреннюю документацию, со временем могут получить возможность прикреплять к создаваемому контенту машиночитаемую проверку.

Корпоративным покупателям нужно будет решить, что именно водяной знак может законно доказать. Он может помочь определить контент, который остается близким к выводу Claude, но не решит случаи смешанного авторства, сильно отредактированных документов или материалов, скопированных через несколько инструментов. Организациям, использующим водяные знаки в кадровых, образовательных или комплаенс-решениях, понадобятся политики для неопределенных результатов и возможных ложноотрицательных ответов.

У этого подхода есть и компромисс при внедрении. Водяные знаки могут поддерживать требования прозрачности без отображения видимой метки в каждом ответе, но проверка зависит от доступа к правильной системе обнаружения. Пока Anthropic не опубликует API и не появятся независимые оценки, разработчики не смогут оценить задержку, стоимость, надежность или совместимость со сторонними системами управления контентом.

На что смотреть дальше

Первым сигналом станет выпуск Anthropic API обнаружения водяных знаков, включая документацию, контроль доступа, цены и поддерживаемые типы контента. Затем независимые тесты должны изучить показатели обнаружения на коротких и длинных ответах, при перефразировании, переводе, вычитке и злонамеренном переписывании.

Разработчикам также стоит следить за тем, опубликует ли Anthropic рекомендации по политике для смешанных текстов человека и ИИ, а также за тем, как компания будет работать с кодом, комментариями и документацией. Еще один открытый вопрос — могут ли водяные знаки разных поставщиков моделей распознаваться последовательно или они останутся привязанными к реализации каждой компании.

Наконец, Кодекс прозрачности ЕС и его практическое исполнение определят, станет ли водяной знак базовым требованием для крупных поставщиков моделей или лишь одним из элементов более широкой системы раскрытия информации.

Мнение Creati.ai

Разъяснение Anthropic делает водяные знаки Claude похожими не столько на видимую метку, сколько на скрытый сигнал происхождения. Это может быть полезно для масштабной проверки, но только если инструменты обнаружения точны, доступны и интерпретируются как свидетельство участия модели, а не как окончательное доказательство авторства.

Самая важная проверка начнется после появления API. Пока независимые результаты не покажут, как водяной знак ведет себя при обычном редактировании и в реальных производственных процессах, компаниям следует воспринимать его как развивающийся сигнал для управления, а не как самостоятельное заключение о соответствии требованиям.

Рекомендуемые

Anthropic объясняет, как будут работать текстовые водяные знаки Claude

Anthropic подробно рассказывает о том, как водяные знаки Claude будут выявлять текст, написанный ИИ, какие правки могут их обойти и чего ждать разработчикам.