Политика хранения данных Fable у Anthropic вызвала отказ части корпоративных клиентов и показала, почему обещания нулевого хранения данных не устранили риски доверия к ИИ.

Решение Anthropic хранить журналы использования своей флагманской модели Fable в течение 30 дней, согласно материалу The Information, на который ссылается The Decoder, побудило нескольких крупных клиентов ограничить или заблокировать систему для чувствительных задач. Этот эпизод показывает, что корпоративные заверения об исключении данных из обучения и о хранении данных по-прежнему трудно оценивать и принимать на веру.
Сообщается, что Nvidia ограничивает Fable менее чувствительной работой, а Booz Allen Hamilton запретила его использование для проприетарного программного обеспечения кибербезопасности. Palantir блокирует развёртывание Fable через свою платформу, пока Anthropic не предоставит то, что компания называет безотзывными гарантиями нулевого хранения данных. Эта реакция превратила политику, призванную поддерживать мониторинг злоупотреблений, в проверку того, способны ли поставщики передовой ИИ удовлетворить ожидания корпоративных и государственных покупателей в области контроля данных.
Anthropic ввела 30-дневную политику хранения журналов в июне, чтобы защититься от того, что The Decoder называет «сложными и новыми атаками». Однако для клиентов, работающих с интеллектуальной собственностью, исходным кодом, исследованиями в области безопасности или операционными данными, хранение журналов создаёт иной риск: чувствительные запросы и ответы могут оставаться доступными поставщику или стать частью более широкой внутренней системы управления данными.
Сообщённая реакция особенно примечательна, поскольку Nvidia инвестировала в Anthropic и поставляет оборудование, используемое при разработке моделей компании. Вице-президент Nvidia по Enterprise AI Джастин Бойтáно сообщил The Information, что компания считает, что нулевое хранение данных, или ZDR, должно быть включено по умолчанию. Вместо этого Nvidia использует собственные модели Nemotron для внутренних приложений, таких как ИИ-поддерживаемый мониторинг цепочки поставок, а Fable оставляет для менее чувствительных задач, включая проекты с открытым исходным кодом.
Booz Allen Hamilton, ранний пользователь модели Mythos от Anthropic, по сообщениям, запретила сотрудникам использовать Fable для проприетарного ПО кибербезопасности. Технический директор Билл Васс сказал, что компания опасалась, что модель может обучаться на её коде. Позиция Palantir также имеет коммерческое измерение: компания выигрывает, когда клиенты запускают модели через её контролируемую платформу, а не подключаются напрямую к внешним поставщикам. Этот стимул не отменяет опасения, но важен как контекст при оценке силы возражения компании.
Сообщается, что Anthropic перешла к программе журналов безопасности, управляемой клиентом, после сопротивления со стороны корпоративных заказчиков и решения OpenAI в августе позволить клиентам GPT-5.6 Cyber хранить журналы безопасности на собственных серверах. По исходным материалам, аналогичная программа Anthropic должна быть запущена для отдельных клиентов осенью. Имеющиеся сообщения не устанавливают, насколько широко программа будет доступна и будет ли она охватывать все типы корпоративного взаимодействия.
Дополнительная сложность в том, что нулевое хранение относится к сохранённому контенту, но не обязательно ко всей информации, производимой при использовании клиентом ИИ-сервиса. The Decoder сообщает, что Anthropic и OpenAI собирают метаданные и технические данные об использовании от корпоративных клиентов. OpenAI описывает часть этой информации как де-идентифицированную и говорит, что автоматические классификаторы и инструменты безопасности анализируют бизнес-данные, чтобы понять, как используются её сервисы. Компания утверждает, что эти классификации содержат метаданные, а не сами исходные бизнес-данные.
Это различие устроило не всех клиентов. Сообщения указывают, что некоторые организации по-прежнему не уверены, что именно включают метаданные, как долго они хранятся и могут ли они раскрывать коммерчески ценные закономерности. Для команд закупок вопрос, таким образом, шире, чем просто хранит ли поставщик запросы. Он включает журналы, телеметрию, классификаторы, записи отладки, системы мониторинга злоупотреблений и любую производную информацию, используемую для улучшения продуктов или выявления сбоев.
Ключевые утверждения в этой истории основаны на сообщённых решениях клиентов и комментариях руководителей, а не на независимом аудите систем Anthropic или OpenAI. Материал The Information, пересказанный The Decoder, служит основой для описаний ограничений Nvidia, внутреннего запрета Booz Allen Hamilton и политики развёртывания Palantir. Предстоящее решение Anthropic о клиентском управляемом логировании также приводится здесь как сообщение, а не как документированная полная публичная спецификация продукта.
Спор выходит за рамки прямого обучения моделей. Бывший сооснователь OpenAI Джон Шульман описывал спектр возможных способов использования данных клиентов — от прямого предобучения до дистилляции и задач обучения с подкреплением, построенных на трассах пользователей. Он утверждал, что де-идентификация слабо защищает от утечки интеллектуальной собственности, и призывал к более строгим нормам раскрытия. В более позднем уточнении Шульман сказал, что данные пользователей вряд ли внесут значительный вклад в рост возможностей на переднем крае по сравнению с крупномасштабным предобучением и обучением с подкреплением. Тем не менее он отметил, что такие данные могут помочь выявлять режимы отказов и сложные реальные случаи.
Исследователь Сара Хукер подняла связанную проблему: методы синтетических данных могут позволить лаборатории извлекать полезные статистические закономерности без прямого хранения или воспроизведения исходного материала. Это важные технические возможности, но источник не подтверждает, что Anthropic или OpenAI использовали данные какого-либо конкретного клиента таким образом. Вместо этого они показывают, почему договорные формулировки, сосредоточенные только на «обучении», могут оставлять клиентов в неведении относительно производных сигналов и рабочих процессов разработки моделей.
Опасения стали более осязаемыми после того, как математик Тристан Бакмастер и соавтор Левент Алпёге заявили, что использовали Codex от OpenAI при работе над уравнениями Навье — Стокса, а затем увидели, как OpenAI представила прорыв с похожим путём решения. Сначала OpenAI заявила, что не может исключить вклад анонимизированных продуктовых данных, но позже сказала, что запросы из соответствующего периода не могли повлиять на систему. Этот инцидент не доказал злоупотребление, но показал, как быстро может разрушаться доверие, когда исследователи не могут независимо проследить, как обрабатывались их входные данные.
Практический вывод для команд по ИИ-продуктам таков: обещание поставщика «не обучать на бизнес-данных» — лишь один из множества механизмов контроля. Команды, внедряющие модели для программирования, безопасности, исследований или операций, должны картировать весь путь данных: хранение запросов, журналы ответов, мониторинг злоупотреблений, доступ службы поддержки, генерацию метаданных, сроки хранения, субподрядчиков и процессы улучшения модели.
Разработчики могут отвечать на это, переводя чувствительную работу на самохостинг или внутренне контролируемые модели, такие как Nemotron от Nvidia, разделяя низкорискованные и высокорискованные нагрузки или требуя клиентского управления логированием. Эти подходы могут снизить экспозицию, но добавляют затраты на инфраструктуру, оценку, обновления моделей и операционную поддержку. У небольших компаний может быть меньше альтернатив, и они могут быть вынуждены принимать политики поставщиков, которые крупные предприятия способны обсуждать.
Спор также поднимает конкурентный вопрос. Лаборатории на переднем крае хотят получать реальные сигналы использования, чтобы повышать надёжность и выявлять атаки, а корпоративные покупатели хотят, чтобы те же взаимодействия оставались изолированными. Поставщики, предлагающие точные механизмы контроля хранения, проверяемые политики телеметрии и чёткие границы вокруг производных данных, могут получить преимущество даже тогда, когда их модели не являются сильнейшими по бенчмаркам.
Непосредственный сигнал — масштаб программы клиентского управления логированием Anthropic: какие клиенты получают доступ, охватывает ли она всё использование Fable и остаются ли какие-либо метаданные у Anthropic. Покупателям также следует следить за более чёткими определениями «де-идентифицированных» данных у OpenAI и других поставщиков, включая сроки хранения и допустимые способы использования.
Второй сигнал — восстановят ли Nvidia, Booz Allen Hamilton и Palantir более широкий доступ к Fable после изменения политики. Дополнительные раскрытия клиентов, независимые аудиты или шаблоны контрактов могут показать, что рынок движется от общих заверений к проверяемым механизмам контроля. И наоборот, продолжение использования отдельных внутренних моделей для чувствительной работы будет означать, что доверие остаётся ограничением для внедрения, а не просто деталью закупок.
Спор вокруг Fable не доказывает, что ИИ-лаборатории тайно обучаются на каждом корпоративном запросе. Он показывает, что нынешние политики часто оставляют слишком много пространства для интерпретации. «Не обучать» и «нулевое хранение данных» решают важные риски, но не объясняют полностью, что происходит с телеметрией, сигналами обнаружения злоупотреблений, производными данными или временным доступом со стороны систем поставщика.
Для покупателей ИИ доверие становится вопросом архитектуры и управления, а не маркетинговой формулировкой. Поставщики, делающие потоки данных наблюдаемыми, настраиваемыми и юридически закреплёнными, будут лучше позиционированы для привлечения чувствительных нагрузок. До тех пор компании будут продолжать отделять удобное использование ИИ от работы, которую считают слишком ценной, чтобы передавать её непрозрачному сервису модели.