До сих пор не существует окончательного юридического ответа на вопрос о том, является ли обучение таких моделей, как ChatGPT, Gemini и Claude, на книгах и опубликованных произведениях нарушением авторского права. Вопрос заключается не только в том, использовались ли произведения без согласия их правообладателей, но и в том, как они были получены, с какой целью использовались и конкурирует ли результат с исходным рынком либо в достаточной степени меняет характер произведения.
Вопрос становится ещё более чувствительным, поскольку многие авторы, не зная об этом и не давая согласия, внесли вклад в разработку инструментов искусственного интеллекта, которые могут конкурировать с источниками их дохода. Однако американское законодательство, не обновлявшееся с 1976 года, оставляет судам задачу применять устаревшие принципы к технологии, которая работает с триллионами слов и создаёт новые тексты.
Решение по делу Anthropic не означает, что обучение незаконно
В одном из наиболее значимых решений такого рода судья William Alsup обязал компанию Anthropic выплатить крупное мировое соглашение в размере 1,5 миллиарда долларов группе писателей, чьи произведения использовались для обучения моделей компании. На первый взгляд это решение может показаться победой авторов, однако одновременно судья постановил, что сам процесс обучения моделей был законным.
Наказание было связано с тем, что Anthropic получила книги из нелегальных электронных библиотек, известных как «теневые библиотеки», а не с самим использованием произведений для обучения. Alsup сравнил способ, которым языковые модели усваивают тексты, со способом, которым писатель читает и изучает литературу, а затем создаёт другое произведение, вместо того чтобы буквально копировать или заменять оригинал.
По мнению адвоката Cathy Gellis, специализирующейся на интеллектуальной собственности, авторском праве и технологиях, эта часть решения может оказаться более полезной для компаний, занимающихся искусственным интеллектом, чем для авторов. Закон сосредоточен на копировании и не обязательно рассматривает использование, чтение или усвоение произведения так же, как его воспроизведение.
Добросовестное использование не разрешает все случаи
Многие дела связаны с принципом «добросовестного использования» — исключением, допускающим использование защищённых материалов без прямого разрешения в таких случаях, как критика, пародия, образование и другие. Суды обычно рассматривают несколько факторов, включая характер и цель использования, объём использованного материала и влияние использования на рынок.
Однако применение этих факторов к обучению искусственного интеллекта остаётся неоднородным. Jason Henderson, адвокат и основатель практики в области интеллектуальной собственности и СМИ в JWL International, объясняет, что суды склонны занимать более жёсткую позицию, когда целью обучения является создание продукта, непосредственно конкурирующего с владельцем контента или его рынком. Если же использование не выглядит конкурентным, суды могут найти основания признать его допустимым.
Это различие проявилось в деле Thomson Reuters против компании Ross Intelligence. Ross использовала контент Thomson Reuters для создания юридической платформы на основе искусственного интеллекта, конкурировавшей с её продуктом. Судья Stephanos Bibas пришёл к выводу, что использование Ross не было преобразующим, поскольку оно не имело «дополнительной цели или иного характера» по сравнению с контентом Thomson Reuters. Поэтому в этом деле использование не было признано добросовестным.
Однако аргумент о том, что чат-боты конкурируют с писателями, поскольку используют их произведения для создания новых искусственных книг, пока не привёл к такому же результату в судах, согласно материалу. Это не означает, что аргумент окончательно отклонён: спор по-прежнему открыт для рассмотрения с учётом различных обстоятельств и решений.
Обучение — не то же самое, что авторские права на созданный результат
Важно отделять вопрос об использовании произведений для обучения модели от вопроса о возможности защиты авторским правом текстов, создаваемых искусственным интеллектом. В деле Thaler v. Perlmutter суд постановил, что произведение, полностью созданное искусственным интеллектом, не пользуется защитой авторского права.
Это порождает самостоятельные вопросы: как доказать, было ли произведение создано искусственным интеллектом? Как определить долю вклада инструмента по сравнению с вкладом человека-автора? Gellis приводит для сравнения более простой пример: писатель, создающий роман в Microsoft Word и использующий функцию проверки орфографии, не ожидает, что компания станет владельцем романа. Однако инструменты искусственного интеллекта требуют пересмотра границ между технической помощью и человеческим творчеством.
Анализ certi.news: что меняется на практике?
Настоящее изменение заключается не в появлении единого правила, разрешающего или запрещающего обучение, а в переходе спора к более конкретным вопросам. Источник данных может изменить правовой результат, как показало решение по делу Anthropic; коммерческая цель может иметь решающее значение, если обучение приводит к созданию продукта, конкурирующего с владельцем контента, как в деле Ross Intelligence. Поэтому компаниям недостаточно заявлять, что модель создаёт новый текст, а авторам недостаточно доказать лишь то, что их произведения попали в обучающие данные.
Для компаний, занимающихся искусственным интеллектом, предварительные решения означают, что процедуры получения обучающих данных стали юридическим фактором, не менее важным, чем сама разработка модели. Для писателей и издателей действующее решение не подтверждает наличие автоматического права запрещать любое использование для обучения, но показывает, что источник копий и влияние конечного продукта на рынок могут дать более веские основания для иска.
Самый важный открытый вопрос связан с противоречиями в будущих решениях. Большинство компаний, занимающихся искусственным интеллектом, по-прежнему сталкиваются с незавершёнными исками, и первые решения могут повлиять на отрасль ещё до того, как позднее будут окончательно утверждены или отменены другими судами. Поэтому эти дела пока не дают устойчивого решения, а лишь очерчивают временные границы, которые будут оставаться изменчивыми по мере продолжения судебных разбирательств.