
Законность обучения моделей ИИ на книгах, защищённых авторским правом, по-прежнему не урегулирована, несмотря на важное судебное решение, которое признало обучение модели одной компании законным. Анализ TechCrunch недавних споров об авторском праве показал, что решающим вопросом может быть не то, использовали ли разработчики защищённые произведения, а то, как они их получили и конкурируют ли их продукты ИИ с исходными рынками.
Эта неопределённость затрагивает компании, создающие системы вроде ChatGPT, Gemini и Claude, а также авторов, издателей, корпоративных покупателей и разработчиков, внедряющих генеративный ИИ в продукты. Суды применяют правила авторского права, написанные за десятилетия до появления машинного обучения в крупном масштабе, что порождает ранние решения, способные влиять на отрасль, не разрешая более широкий спор.
Одно из самых значимых дел касалось Anthropic и группы писателей, чьи книги использовались для обучения моделей ИИ компании. По данным TechCrunch, судья Уильям Алсуп постановил, что обучение ИИ Anthropic было законным, но обязал компанию выплатить 1,5 млрд долларов по урегулированию спора об авторском праве, поскольку она получила некоторые книги из несанкционированных онлайн «теневых библиотек».
Это различие имеет ключевое значение. В решении загрузка защищённых авторским правом произведений для обучения языковой модели была приравнена скорее к чтению и обучению на литературе, чем к воспроизведению книги для распространения. Санкция же была сосредоточена на предположительно незаконном получении учебных материалов.
Кэти Геллис, юрист, специализирующаяся на интеллектуальной собственности, авторском праве и технологиях, сказала TechCrunch, что такая логика может быть благоприятной для компаний ИИ, поскольку закон об авторском праве обычно фокусируется на копировании, а не просто на использовании или восприятии произведения. Однако финансовые последствия и то, как в решении рассматривается источник данных, всё ещё создают значительные риски для разработчиков моделей.
Это дело также не гарантирует, что другие суды придут к тому же выводу. Решение по Anthropic остаётся влиятельным первоначальным вердиктом в гораздо более широком массиве рассматриваемых споров.
Большая часть юридической дискуссии сосредоточена на добросовестном использовании — доктрине, которая может разрешать использование защищённого авторским правом материала без лицензии для таких целей, как критика, образование, пародия или другие преобразующие виды деятельности. Суды обычно оценивают цель использования, объём используемого материала и его влияние на рынок оригинального произведения.
Джейсон Хендерсон, юрист по интеллектуальной собственности, которого цитирует TechCrunch, сказал, что суды особенно обеспокоены, когда компания обучается на защищённом авторским правом материале, чтобы создать продукт, напрямую конкурирующий с исходным материалом. Эта озабоченность повлияла на отдельное дело между Thomson Reuters и Ross Intelligence, компанией в сфере юридических исследований, которая использовала контент Reuters для разработки конкурирующей ИИ-платформы.
В этом споре судья Стефанос Бибас установил, что использование Ross не было преобразующим, поскольку у него не было достаточно иного назначения или характера по сравнению с продуктом Thomson Reuters. Это решение служит предупреждением для компаний ИИ: данные для обучения и выходы модели могут получать разное правовое отношение в зависимости от того, заменяет ли итоговая система исходный рынок.
Такая логика может стать важной для издателей и авторов, утверждающих, что чат-боты могут генерировать синтетические книги, краткие содержания или другой контент, конкурирующий с их работами. TechCrunch сообщил, что такой аргумент пока не добился успеха в суде, поэтому его итоговая сила остаётся неопределённой.
Имеющиеся доказательства не устанавливают единого правового правила для всего обучения ИИ. Решение по Anthropic поддерживает возможность того, что само обучение может считаться законным использованием, тогда как дело Ross Intelligence показывает, что напрямую конкурирующий продукт может ослабить защиту добросовестного использования. Разные факты о происхождении данных, цели продукта, поведении выходных данных и влиянии на рынок могут привести к разным результатам.
Оба дела также уже, чем вопрос в масштабах всей отрасли. Решение, касающееся книг, полученных из незаконных источников, может не урегулировать статус книг, полученных через лицензированные базы данных, веб-скрейпинг или иные способы доступа. Точно так же решение по продукту для юридических исследований может не перенестись напрямую на универсальный чат-бот.
Геллис сказала TechCrunch, что первоначальные решения формируют поведение компаний, но позже могут быть отменены или ограничены по мере продвижения судебных процессов. Большинство крупных компаний ИИ по-прежнему вовлечены в текущие споры об авторском праве, поэтому нынешние решения следует рассматривать как сигналы, а не как окончательное урегулирование права.
Статья также различает споры об обучении и вопросы авторского права на произведения, созданные ИИ. В деле Thaler v. Perlmutter суд постановил, что работа, полностью созданная ИИ, не подлежит авторско-правовой защите. Это отдельное правило поднимает практические вопросы о том, насколько велик должен быть вклад человека для получения защиты и как вообще проверять, было ли произведение создано ИИ или с его помощью.
Для разработчиков моделей происхождение данных становится вопросом продукта и управления рисками, а не второстепенной юридической деталью. Дело Anthropic показывает, что получение учебных материалов из несанкционированных репозиториев может создавать ответственность даже тогда, когда сама теория обучения модели выдерживает судебную проверку. Поэтому компании могут столкнуться с давлением документировать, откуда взялись книги и другие защищённые произведения, как они обрабатывались и какие механизмы контроля регулируют будущий приём данных.
Командам продуктов также нужно оценивать, позиционируются ли их системы как инструменты общего назначения или как замена для конкретного рынка контента. Решение по Ross Intelligence показывает, что узко нацеленный ИИ-продукт, конкурирующий с устоявшимся информационным сервисом, может столкнуться с иным анализом добросовестного использования, чем система с более широким, более преобразующим назначением.
Корпоративным покупателям следует ожидать, что гарантии по авторскому праву останутся ограниченными. Поставщики могут описывать свои практики работы с данными и политику возмещения убытков, но ни один контракт не устранит неопределённость, пока суды ещё решают, следует ли отдельно анализировать обучение, поиск, генерацию выходных данных и замену рынка.
Исследователи и основатели сталкиваются с похожим компромиссом. Использование высококачественных материалов, защищённых авторским правом, может улучшить систему, но юридическая ценность таких данных зависит от способа их получения и предполагаемого использования. Пока не появится больше зрелых дел, консервативное управление данными и чёткая документация могут быть почти столь же важны, как и производительность модели.
Самые важные сигналы придут из последующих решений по текущим делам об авторском праве с участием компаний ИИ, особенно из тех, что касаются книг, полученных законными каналами, а не из теневых библиотек. То, как суды будут относиться к ответам чат-ботов, которые напоминают произведения авторов или конкурируют с ними, также прояснит, как оценивается вред рынку.
Разработчикам следует следить за более точными правилами о лицензированных учебных данных, системах отказа, коллективном лицензировании и доказательных стандартах, используемых для подтверждения того, какие данные попали в модель. Ещё один ключевой вопрос — сохранят ли апелляционные суды различие между законным обучением и незаконным приобретением, установленное в споре Anthropic.
Отрасли также следует отслеживать, как суды применяют стандарты охраноспособности к работам с участием ИИ. Граница между человеческим авторством и машинной помощью повлияет на издателей, софтверные компании и пользователей, которые полагаются на генеративные инструменты для создания коммерческого контента.
Главный вывод не в том, законно или незаконно обучение ИИ на книгах, защищённых авторским правом. Суть в том, что законность зависит от цепочки фактов: как был получен материал, что делает с ним модель или продукт, конкурирует ли он с исходным рынком и насколько в результате виден человеческий авторский вклад.
Для компаний ИИ самый безопасный подход — воспринимать юридическую неопределённость как операционное ограничение. Документированное происхождение данных, анализ рынка по конкретным продуктам и адаптируемые стратегии обучения окажутся устойчивее, чем предположение, что одно благоприятное решение закрывает вопрос. Судебные решения начинают определять границы, но стабильную линию они пока не провели.
Юридический анализ TechCrunch показывает, что обучение ИИ на защищённых авторским правом книгах остаётся нерешённым, а решения по добросовестному использованию создают риски для разработчиков моделей.