Пабло Пикассо, одному из самых известных живописцев XX века, приписывают слова: «Хорошие художники копируют, великие – воруют»41. В литературе и изобразительном искусстве принято подражать стилю других авторов, и это часто рассматривается как необходимое условие творческого успеха. Конечно, такое подражание имеет свои границы, которые в законе обозначены как интеллектуальная собственность. Понятие интеллектуальной собственности как вида собственности, на который можно претендовать по закону, возникло в Англии в XVII веке42. В Соединенных Штатах раздел 8 статьи I Конституции гласит, что Конгресс обладает полномочиями «содействовать прогрессу в науке и полезных искусствах путем предоставления авторам и изобретателям исключительных прав на соответствующие труды и открытия на ограниченный срок»43. Существует несколько различных видов защиты интеллектуальной собственности: патенты для изобретателей, торговые марки для корпоративных логотипов и символов, коммерческие тайны для закрытой информации, такой как формула Coca-Cola, – однако наиболее спорные юридические вопросы, связанные с генеративным ИИ, касаются потенциальных нарушений авторских прав при обучении моделей и генерации ими результатов.
Авторские права – это исключительные права на произведение творческого самовыражения, будь то изображение, текст, фильм или песня. Обычно владелец авторских прав является единственным, кто может копировать, распространять и демонстрировать или исполнять произведение, и это право ограничено временны´м периодом, по истечении которого работа переходит в общественное достояние (в Соединенных Штатах авторское право начинает действовать с момента создания произведения и заканчивается через 70 лет после смерти создателя)44. Управление по авторским правам США заявило, что их политика заключается в том, что текст, изображения и другие медиа, созданные с помощью искусственного интеллекта, не подлежат защите авторским правом, а вот работы людей, в которых есть сгенерированные с помощью ИИ элементы, могут быть защищены при условии, что человек вложил в них достаточно своих творческих усилий45. Но наиболее насущный юридический вопрос на сегодня, касающийся LLM, а также моделей для генерации изображений, заключается не в правомерности защиты их авторским правом, а в том, действительно ли они нарушают существующие авторские права художников и писателей, чьи работы вошли в их обучающие данные.
АВТОРСКИЕ ПРАВА – это исключительные права на произведение творческого самовыражения, будь то изображение, текст, фильм или песня.
Авторское право, хоть и предоставляет исключительные права на использование, ни в коем случае не является абсолютным. Добросовестное использование – это правовая доктрина, которая определяет, когда допустимо использовать материалы, защищенные авторским правом, без разрешения владельца авторских прав46. Например, пародия обычно рассматривается судом как добросовестное использование, и именно поэтому известный пародист Странный Эл Янкович (Weird Al Yankovic) может продавать с коммерческой целью песни с дублированной мелодией, защищенной авторским правом, и своими собственными комичными текстами (хотя Янкович заявляет на своем веб-сайте, что он все равно получает разрешение от авторов оригинала, чтобы поддерживать отношения, которые выстраивал на протяжении многих лет)47. Как определено в Законе США об авторском праве 1976 года, добросовестное использование зависит от четырех факторов (показаны ниже на рис. 4.7).
Рис. 4.7. Четыре фактора, определяющие добросовестное использование материалов, защищенных авторским правом48
Первый фактор, «цель и характер использования», определяется тем, как и почему используется материал, защищенный авторским правом. Коммерческое использование менее вероятно будет считаться добросовестным по сравнению с использованием в образовательных или некоммерческих целях. Например, профессор колледжа может распространять распечатки картин на лекциях по истории искусств, но если кто-то решится продавать футболки с тем же самым изображением, то у него возникнут проблемы. Еще один случай, который относится к этому фактору, – это «преобразующее использование». Фактически суды США пришли к выводу, что если характер использования является преобразующим, то есть добавляется новый элемент, который коренным образом меняет произведение, это не является нарушением авторских прав. Определение преобразующего использования также зависит от того, используется ли производное произведение в целях, отличных от использования оригинального произведения или получения удовольствия от него, – и это важный аргумент в защиту компаний, которые разрабатывают LLM.
Второй фактор, «сущность защищенной авторским правом работы», относится к тому, что к разным типам материалов применяются разные степени защиты. Поскольку первоначальной целью авторского права было стимулирование свободного и творческого выражения, использование более «творческих» работ, таких как песни, пьесы и романы, с большей вероятностью будет считаться добросовестным по сравнению с использованием работ, основанных на фактах или технологиях и защищенных авторскими правами. Другими словами, можно обоснованно утверждать, что упоминание поэтических строк в новом стихотворении является добросовестным использованием, но в отношении фрагмента из журналистского расследования это не так очевидно.
Третий фактор оценивает, какой объем исходной работы был использован повторно. Если значительная часть или почти вся работа, то это с меньшей вероятностью будет считаться добросовестным использованием, чем при действиях с небольшим объемом.
Четвертый и последний фактор касается того, будет ли влиять использование материалов, защищенных авторским правом, на рынок этой работы и в какой степени. Например, если продавец без разрешения распространяет новый фильм онлайн, это может представлять серьезную угрозу для цифровых продаж или доходов от потоковой передачи этого фильма. Использование, которое наносит ущерб рынку продажи оригинального произведения, вряд ли будет считаться добросовестным46.
Эти формулировки кажутся слегка размытыми, потому что так оно и есть: ни один из факторов не является строго определенным правилом, и они все рассматриваются в совокупности, если предъявляется иск об авторском праве. Однако прежде, чем перейти к судебным искам, которые уже были поданы против разработчиков LLM, давайте рассмотрим дело, которое также связано с использованием в интернете огромного количества текстов, защищенных авторским правом, – «Гильдия авторов против Google»49.
В 2015 году Google сотрудничала с несколькими крупными научными библиотеками для оцифровки их книжных коллекций, насчитывающих около двадцати миллионов томов. Благодаря партнерским отношениям технический гигант получил доступ к книгам, сканировал их и позволял людям искать в них фрагменты текста – и все это без разрешения владельцев авторских прав и без уплаты лицензионных сборов. Дело было передано в Апелляционный суд второго округа, который согласился с мнением суда низшей инстанции, что усилия Google по оцифровке представляют собой добросовестное использование, поскольку функция поиска предоставляет общественности только доступ к информации о книгах, которого у них в противном случае не было бы, и хотя система Google просматривала полный текст книги, поиск выдавал только фрагменты подходящего текста, а не всю книгу целиком. Концепция использования всего исходного материала для принципиально другого инструмента аналогична идее обучения больших языковых моделей.
В целом большие языковые модели, о которых мы говорим, могут быть защищены доктриной о добросовестном использовании, поскольку модель – это совершенно иной продукт, нежели любой из документов, и, следовательно, использование обучающих материалов будет преобразующим. Ситуация осложняется тем, что, как показали пользователи, LLM иногда можно заставить дословно воспроизводить текст. Регулярно воспроизводить «запоминание» исходных материалов сложно из-за вероятностной природы LLM, а также из-за неполного понимания, что именно и как она изучает, поэтому даже их разработчики с трудом могут сказать, когда модель будет воспроизводить обучающие тексты дословно. Однако, учитывая прецедент «Гильдия авторов против Google», шансы на то, что обучение LLM будет признаваться добросовестным использованием, кажутся значительными.
Большие языковые модели – не единственные генеративные модели, которые вызывают ажиотаж в сфере авторского права. Как упоминалось ранее, существуют великолепные генеративные модели, способные создавать все виды синтетических медиа, включая изображения, звук и видео. Некоторые из самых популярных моделей, включая Midjourney и Stable Diffusion, представляют собой модели преобразования текста в изображение: пользователи могут описать, как должно выглядеть их изображение, и модель сгенерирует его за них.
Модели для создания изображений, как и LLM, обучаются на огромных объемах данных из интернета. Аналогично наборам данных в виде текста на Common Crawl, существуют датасеты изображений, например LAION‐5B – набор из 5,8 миллиарда изображений, собранных некоммерческой организацией Large-Scale Artificial Intelligence Open Network (LAION). LAION‐5B используется компанией Stability AI, разработчиком Stable Diffusion, и другими; он состоит из изображений, которые находятся в открытом доступе в интернете, включая стоковые изображения и фотографии из различных изданий. Один немецкий фотограф, обнаружив, что некоторые из его стоковых изображений были использованы в LAION‐5B, попросил их удалить. Компания LAION ответила, что такой запрос выполнить невозможно, поскольку в базе данных есть только ссылки на изображения, но сами они не хранились, и поэтому нельзя быстро установить, какие именно фотографии были взяты из его портфолио. Законодательство об авторском праве в Германии, как и во многих других странах, допускает анализ данных, если они «доступны на законных основаниях» и впоследствии удаляются, но появление генеративных моделей заставило обратить на этот принцип более пристальное внимание51. Позже Stability AI объявила, что они готовы удовлетворять запросы на удаление от правообладателей, чьи работы были включены в набор данных LAION51.
Компания Getty Images также подала в суд на Stability за использование более 12 миллионов фотографий из ее коллекции50, 52. В иске они написали:
«Потратив значительные суммы, на протяжении почти трех десятилетий Getty Images собирала коллекцию сотен миллионов высококачественных визуальных материалов… Многие из этих изображений были созданы штатными фотографами Getty Images по заказу, другие были приобретены компанией у третьих лиц с передачей соответствующих авторских прав, а остальные лицензированы для Getty Images сотнями ее контент-партнеров или сотнями тысяч фотографов, которые зависят от лицензионных доходов, полученных на Getty Images»53.
Подтекст ясен: генеративные модели на основе ИИ представляют реальную угрозу для Getty и стоковой фотографии как отрасли. Getty надеется получить компенсацию за свою работу и нарушение авторских прав, но, как и в случае с большими наборами текстовых данных, трудно определить, сколько информации модель сохраняет из любого отдельного изображения, и, опять же, использование данных компанией Stability AI может считаться преобразующим.
Занятно, но у Getty могут быть более веские обвинения из-за артефакта, который присутствует в обучающих данных:
«Часто в выходных данных, генерируемых Stable Diffusion, встречается модифицированная версия водяного знака Getty Images, что создает путаницу в отношении источника изображения и ложно указывает на связь с Getty Images. Некоторые изображения, сгенерированные на Stable Diffusion, эстетически приятны, однако другие могут получиться гораздо более низкого качества и порой варьируются от причудливых до гротескных. Появление товарных знаков Getty Images в низкокачественных, непривлекательных или оскорбительных изображениях Stability AI подрывает авторитет товарного знака и является дальнейшим нарушением федеральных законов и законов штатов о товарных знаках»53.
Stable Diffusion или даже ее пользователи могут быть уличены в нарушении прав на товарные знаки, если на изображениях появляется водяной знак Getty Images, хотя Stability AI, несомненно, быстро отреагирует на такие события. В целом, это относительно неизведанная область права.
Все становится еще более рискованным, когда модель запоминает не только изображение, сделанное художником-человеком, но и фактически запоминает и воспроизводит его стиль. В дополнение к генерации фотореалистичных визуализаций, генеративные модели, включая Midjourney и Stable Diffusion, способны создавать иллюстративный материал в определенных стилях, как было описано в разделе 4.2. Стиль, как правило, не защищен авторским правом, но не сложно понять, почему художники думают, что такая имитация может обесценить или умалить их работу. Выдающаяся художница-аниматор Сара Андерсен, которая публикует веб-комиксы из коллекции «Каракули Сары», написала публикацию в New York Times о том, как ультраправые интернет-тролли позаимствовали ее комиксы, отредактировав текст и изображения, чтобы изменить их значение. На рис. 4.8 показан пример иллюстрации, сгенерированной инструментом на основе ИИ в ее художественном стиле с явно искаженным текстом, но сохраненными визуальными элементами. «Когда я заглянула на веб-сайт haveibeentrained.com, созданный для того, чтобы люди могли осуществлять поиск по датасету LAION, я нашла там так много своих работ, что они заполнили весь экран моего рабочего стола», – заявила Андерсен и выразила беспокойство, что инструменты искусственного интеллекта снова будут использованы для искажения ее творений54.
Рис. 4.8. Изображение, созданное ИИ на базе генеративной модели с открытым исходным кодом с помощью промпта «Веб-комикс Сары Андерсен»
Андерсен является одним из трех истцов, наряду с Карлой Ортис и Келли Маккернан, подавших коллективный иск против Midjourney, Stability AI и DeviantArt. Как и Андерсен, Маккернан и Ортис обнаружили, что эти инструменты могут создавать изображения в их стилях, что им лично кажется нарушением персональных прав. «Они обучили эти модели на наших работах. Они отняли у нас право решать, хотим мы в этом участвовать или нет», – сказала Ортис54, 55.
Еще неизвестно, чем закончится дело Андерсен, Ортис и Маккернан [50], но люди по всему миру продолжают использовать эти инструменты для создания новых форм искусства и экспериментов с ними. Доктрина добросовестного использования недостаточно строга, и поэтому новые судебные прецеденты могут изменить текущий статус-кво в практиках разработки и использования ИИ-моделей. Но в то же время многие наборы данных и модели, о которых мы говорим, уже распространяются по принципам открытого исходного кода, а это означает, что любой желающий может либо обучить свою собственную модель, либо создать новую версию уже существующей. Независимо от того, будут ли определенные компании менять процедуру создания своего набора данных или они решат в конечном итоге оплатить ущерб или лицензионные сборы, художественные работы, сгенерированные с помощью ИИ, – от комиксов до музыки и поэзии – уже вошли в нашу жизнь.