Обучение систем искусственного интеллекта: защита интеллектуальных прав vs развитие технологий
Автор: Новоселова Л.А., Рузакова О.А., Гринь Е.С.
Журнал: Вестник Пермского университета. Юридические науки @jurvestnik-psu
Рубрика: Частноправовые (цивилистические) науки
Статья в выпуске: 2 (72), 2026 года.
Бесплатный доступ
Введение: активное внедрение технологий искусственного интеллекта и возможность создания с их помощью результатов, сопоставимых с результатами творческой деятельности человека, обусловливают необходимость переосмысления традиционных институтов права интеллектуальной собственности. Цель: настоящее исследование направлено на комплексный анализ правовых проблем, возникающих в связи с использованием результатов, охраняемых в качестве объектов авторских и смежных прав (текстов, изображений, аудио- и видеоматериалов), для обучения алгоритмов искусственного интеллекта, и определение основных ориентаций их гражданско-правового регулирования. Методы: диалектический, формально-логический, функциональный и другие общенаучные методы исследования, а также специально-юридические методы: сравнительно-правовой и формально-юридический. Результаты: установлено, что обучение искусственного интеллекта сопряжено с системными рисками нарушения интеллектуальных прав на каждом технологическом этапе (ввод, обработка, генерация результата). В судебной практике преимущественно рассматриваются иски о нарушении прав на литературные произведения, изображения и аудиоматериалы, при этом доказывание факта использования охраняемых объектов для обучения ИИ представляет особую сложность. В отличие от стран ЕС, имеющих детальное регулирование анализа данных, включая охраняемые объекты, и государств общего права, применяющих доктрину добросовестного использования, в российской правовой системе отсутствует как специальное регулирование, так и единая правовая позиция по данному вопросу, что порождает неопределенность для разработчиков и правообладателей. Выводы: обоснована необходимость разработки механизма комплексного правового регулирования использования объектов интеллектуальных прав для обучения ИИ. Предлагается закрепить в законодательстве специальный способ использования произведений – для анализа и обработки данных, пригодных для применения в моделях ИИ, используемых при создании контента, а также презумпцию необходимости получения согласия правообладателя и выплаты вознаграждения, кроме случаев свободного использования в научных, образовательных и личных целях. Необходимо нормативно закрепить статус лиц, включенных в систему создания моделей ИИ, разработать методики расчета вознаграждения и систему защиты личных неимущественных прав авторов. Результаты могут быть использованы в нормотворческой деятельности и правоприменительной практике.
Искусственный интеллект, интеллектуальная собственность, авторское право, обучение искусственного интеллекта, генеративный искусственный интеллект, добросовестное использование, развитие технологий
Короткий адрес: https://sciup.org/147254269
IDR: 147254269 | УДК: 347.78 | DOI: 10.17072/1995-4190-2026-72-330-358
Training of Artificial Intelligence Systems: Intellectual Property Protection vs Technology Development
Introduction: the active adoption of artificial intelligence technologies and their capacity to generate outputs comparable to those produced through human creative activity necessitate a rethinking of tradi-tional intellectual property law institutions. Purpose: this study conducts a comprehensive analysis of legal issues arising from the use of works protected by copyright and related rights (texts, images, audio and video materials) for the “training” of artificial intelligence algorithms, and also identifies key directions for their regulation under civil law. Methods: dialectical, formal-logical, functional, and other general scien-tific methods, as well as specialized legal methods, namely comparative-law and formal-dogmatic analy-sis. Results: the study has established that the “training” of artificial intelligence entails systemic risks of intellectual property infringement at each technological stage. Court practice predominantly involves claims concerning infringements of rights in literary works, images, and audio recordings; however, prov-ing the actual use of protected works for AI “training” presents particular evidentiary challenges. The Eu-ropean Union has developed fairly detailed rules governing data analysis, including analysis of copyright- and related rights-protected materials; in common law jurisdictions, the fair use doctrine applies to contested scenarios; meanwhile, the Russian legal system lacks not only specific regulation of these relationships but also a unified understanding of the underlying processes and the need to reflect them in law. This legal gap generates uncertainty for both AI developers and rights holders. Conclusions: the article substantiates the need for a comprehensive legal framework governing the use of intellectual property for AI “training.” It is proposed to introduce into legislation a specific mode of use, namely, use for data analysis and processing intended for AI models employed in the generation of content. It appears advisable to establish a presump-tion requiring rights holder’s consent and the payment of remuneration, except in expressly defined cases of free use for scientific, educational, and personal purposes. The study also emphasizes the necessity of defining and legally codifying the status of actors within the AI development ecosystem. Additionally, methodologies for calculating remuneration for rights holders and mechanisms for protecting authors’ moral rights must be developed. The findings may inform legislative drafting and judicial practice.
Текст научной статьи Обучение систем искусственного интеллекта: защита интеллектуальных прав vs развитие технологий
EDN
Данная работа распространяется по лицензии CC BY 4.0. Чтобы просмотреть копию этой лицензии, посетите закрепить в законодательстве специальный способ использования произведений – для анализа и обработки данных, пригодных для применения в моделях ИИ, используемых при создании контента, а также презумпцию необходимости получения согласия правообладателя и выплаты вознаграждения, кроме случаев свободного использования в научных, образовательных и личных целях. Необходимо нормативно закрепить статус лиц, включенных в систему создания моделей ИИ, разработать методики расчета вознаграждения и систему защиты личных неимущественных прав авторов. Результаты могут быть использованы в нормотворческой деятельности и правоприменительной практике.
Технологии искусственного интеллекта оказались частью научных и технических достижений, которые кардинальным образом изменили современную жизнь. Проблемы, связанные с развитием и применением этих технологий, стали одним из самых популярных предметов обсуждения в рамках правовой, экономической, социальной тематики, а также этики и морали. Технологии ИИ внедряются во все сферы – от бытовой, повседневной до сферы государственного регулирования. Так, технология искусственного интеллекта применяется уже в работе законодательных органов, в определении места в существующих правопорядках новых конструкций, видов отношений, их правового регулирования1 [18].
Естественно, что такие масштабные изменения вызвали тектонические потрясения в праве, в том числе в праве гражданском и его подотрасли – праве интеллектуальной собственности. Так, например, по данным ассоциации «Руссофт», около 20 % отечественных разработчиков программного обеспечения в 2024 году применяют генеративный ИИ при создании софта2 .
В одном из последних документов Всемирной организации по интеллектуальной собственности отмечается, что «за последние три десятилетия последовательные волны цифровых инноваций изменили способ создания, распространения и доступа к контенту. В ходе преобразований закон об авторском праве адаптировался, чтобы гарантировать, что создатели получают признание и вознаграждение за свою работу, тем самым поддерживая творческие секторы, которые обогащают наши общества. Однако появление генеративного искусственного интеллекта (GenAI) представляет собой беспрецедентные проблемы и возможности, требуя переоценки существующих правовых рамок и механизмов поддержки для решения сложностей, привнесенных этой технологией»3.
Правовые проблемы, возникшие в связи с появлением, усложнением и широким развитием систем искусственного интеллекта, многообразны, однако в рамках данной статьи необходимо сосредоточиться на механизмах создания, наполнения данными (обучения) таких систем, использование которых направлено на генерирование текстов, изображений, видео- и аудиоконтента. Именно на этой стадии затрагиваются интересы субъектов, обладающих интеллектуальными правами на используемые при обучении объекты. Для целей правового воздействия важно четко определить круг субъектов, связанных с созданием, обучением, развертыванием, использованием систем ИИ, а также характер и условия их ответственности за возможные нарушения интеллектуальных прав. На повестке дня стоит задача поиска правовых механизмов, с одной стороны, обеспечивающих интересы правообладателей, а с другой – не являющихся заградительным барьером для развития инновационных прорывных технологий обработки информации.
В последние годы в мире увеличилось количество судебных споров, в рамках которых к разработчикам моделей ИИ предъявляются претензии правообладателей исключительных прав на контент, использованный для обучения. Многие судебные разбирательства еще не завершены. Уже вынесенные судебные решения во многом основаны на тех правовых подходах, которые выработаны в определенных правовых системах и часто касаются толкования уже принятых нормативных актов.
Разработка и обучение моделей искусственного интеллекта требуют доступа к огромным объемам текстов, изображений, видеоконтента и других материалов, которые могут быть защищены авторским правом и смежными правами. С этой точки зрения представляет интерес рассмотрение данных процессов в контексте следующих вопросов: 1) нарушают ли указанные процессы интеллектуальные права, 2) какие именно формы может приобретать нарушение, 3) кто может являться субъектом ответственности?
В России в целом ряде программных стратегических документов отмечается значимость развития технологий ИИ. Так, Стратегия научно-технологического развития Российской Федерации определяет, что к одним из приоритетных направлений научнотехнологического развития относится переход к передовым технологиям проектирования и создания высокотехнологичной продукции, основанным на применении интеллектуальных производственных решений, роботизированных и высокопроизводительных вычислительных систем, новых материалов и химических соединений, результатов обработки больших объемов данных, технологий машинного обучения и искусственного интеллекта (п. 21)4.
В Концепции развития регулирования отношений в сфере технологий искусственного интеллекта и робототехники до 2024 года5 (далее – Концепция) указывается, что приоритетной целью регулирования отношений в сфере искусственного интеллекта и робототехники на данном этапе их развития является стимулирование разработки, внедрения и использования таких технологий, создания систем искусственного интеллекта и робототехники в доверенном и безопасном исполнении, которое будет способствовать достижению высоких темпов экономического роста, повышению благосостояния и качества жизни граждан, обеспечению национальной безопасности и правопорядка, достижению устойчивой конкурентоспособности российской экономики, в том числе лидирующих позиций в мире в области искусственного интеллекта… (п. 12 разд. II).
Указом Президента РФ от 10 октября 2019 г. № 490 «О развитии искусственного интеллекта в Российской Федерации» (далее – Указ Президента РФ № 490)1 утверждена Национальная стратегия развития искусственного интеллекта на период до 2030 года. Указ Президента РФ от 15 февраля 2024 г. № 1242 внес в нее ряд изменений и дополнений.
Вместе с тем, несмотря на наличие определенных стратегических целей, разработка комплексного правового регулирования отношений, связанных с созданием и функционированием соответствующих технологий, пока находится на самом начальном этапе. Отсутствует полноценный понятийный аппарат, не обозначен круг субъектов, чья деятельность должна регулироваться, не выявлены приоритетные цели и, как следствие, не определены конкретные меры по их достижению. В полной мере это относится и к очевидному конфликту между субъектами, имеющими отношение к разработке и предоставлению потребителям систем искусственного интеллекта, с одной стороны, и правообладателями, чьи интересы защищает право интеллектуальной собственности, – с другой. Между тем экономическая суть такого конфликта ясна: генерируемые с использованием технологий результаты в виде текста, изображений, аудио- и видеоконтента (далее – синтетический контент) в силу простоты и доступности их получения могут лишить экономического смысла деятельность по созданию и продвижению произведений, созданных творческим трудом человека, вытесняя их с рынка. Кроме того, не исключен ущерб и нематериальным правам, особенно если системы ИИ генерируют контент, извращающий идеи автора исходного произведения.
Понятия «искусственный интеллект», «технологии и системы искусственного интеллекта»
Признанного всеми специалистами определения понятия «искусственный интеллект» до настоящего времени не выработано (в том числе специалистами в области программирования, автоматизации, систем управления). Эта задача вряд ли будет решена в ближайшее время, поскольку она связана с созданием единой концепции интеллекта как такового и человеческого интеллекта – в качестве базовой модели.
Для целей правового исследования более перспективным является установление сущностных черт технологий, именуемых «технологии искусственного интеллекта», и систем искусственного интеллекта. Эти понятия, в частности, используются в Концепции 2024 года, где указано, что режим правового регулирования разработки, внедрения и применения технологий и систем искусственного интеллекта и робототехники должен обеспечивать необходимую степень защиты прав и свобод человека и гражданина, отвечать интересам общества и государства
Технологии искусственного интеллекта – это наименование, призванное обозначить набор информационных технологий – машин и систем, созданных с целью решения задач, которые традиционно считаются требующими участия человеческого разума, но функционирующих без такого участия либо с ограниченным участием человека.
Технологии искусственного интеллекта – это не одно программное решение, а отдельное направление в сфере информатизации, построенное на использовании алгоритмов, позволяющих компьютеру обрабатывать большие объемы данных и выявлять (вычислять) на их основе определенные закономерности. В свою очередь, на основе выявленных закономерностей могут быть рассчитаны вероятные результаты, позволяющие предсказывать события и выбирать наиболее приемлемые варианты решений.
В отличие от человеческого разума, который позволяет производить обработку информации и – с тем или иным успехом – создавать результат в любой сфере, в настоящее время системы искусственного интеллекта являются специализированными, каждая из них решает только определенный круг задач, например генерирование текстов, изображений. При этом технология, обеспечивающая обработку данных для создания музыки, не может использоваться для иных целей, например прогнозирования погоды. Создание искусственного интеллекта, способного решать широкий круг когнитивных задач (широкий ИИ), пока является задачей будущего.
В российских нормативных актах предлагается следующее определение технологий искусственного интеллекта: искусственный интеллект – комплекс технологических решений, позволяющий имитировать когнитивные функции человека (включая самообучение и поиск решений без заранее заданного алгоритма) и получать при выполнении конкретных задач результаты, сопоставимые как минимум с результатами интеллектуальной деятельности человека. Комплекс технологических решений включает в себя информационно-коммуникационную инфраструктуру, программное обеспечение (в том числе то, в котором используются методы машинного обучения), процессы и сервисы по обработке данных и поиску решений1.
Данное определение в целом носит не юридический, а скорее публицистический характер и построено на неточном описании технологии ИИ, которая ни в коей мере не имитирует когнитивные функции человека. Производимая соответствующими программами работа не может быть охарактеризована как «размышление», «осознание» – речь идет о математических методах вычисления вероятностей на основе огромного массива данных и корректировок результатов вычислений, которые могут постоянно уточнятся при поступлении новых данных для обработки. Если технологии искусственного интеллекта и имитируют деятельность человека, то, очевидно, имитация касается полученного результата, а не процесса.
Тем не менее вышеприведенное определение содержит важные указания на наличие инфраструктуры, программного обеспечения, элементов машинного обучения.
Квалифицирующим признаком рассматриваемых технологий является то, что информационные системы самостоятельно, без предварительного составления человеком перечня возможных решений, формируют правила и результаты на основе анализа зависимостей, применяя исходные наборы данных. Здесь и далее понятие «технологии ИИ» используется для обозначения систем и программ, направленных на решение индивидуальных задач (расчет прогноза погоды, генерация текста или изображения и т. д.). Такие технологии основаны на машинном обучении и использовании информационных баз (включая базы данных в том виде, как их определяет гражданское законодательство), исходя из содержания которых «вычисляется» результат.
В целом ряде стран термины «технологии искусственного интеллекта», «системы искусственного интеллекта», «модели искусственного интеллекта» определены либо в законодательстве, либо на уровне прецедента, но, как правило, с оговоркой, что дефиниция дается для определенных целей.
Например, в законодательстве Китайской Народной Республики не существует единого универсального определения технологий искусственного интеллекта, применяемого во всех законах и нормативных актах. Ключевые нормативные предлагают свои определения, которые отражают тот или иной технологический контекст. Так, Временные меры по управлению сервисами генеративного искусственного интеллекта (вступили в силу 15 августа 2023 г.) относят к технологиям ИИ модели и связанные с ними технологии, способные генерировать текст, изображения, звук, видео и другой контент на основе алгоритмов (ст. 22)2. Наиболее широкое определение предлагается в Положении Шеньчженя об администрировании искусственного интеллекта (вступили в силу 1 ноября 2022 г.)3, статья 2 которого рассматривает искусственный интеллект как относящийся к технологиям, связанным с использованием компьютеров или контролируемых машин для имитации, расширения и усиления человеческого интеллекта, восприятия окружающей среды, получения и применения знаний для решения проблем, принятия решений и реализации целей.
Пункт 3 главы 3 Закона США о национальной инициативе в области искусственного интеллекта 2020 года4 определяет данный термин как «машинную систему, которая может по заданному человеком набору целей делать предсказание, давать рекомендации и принимать решения, влияющие на физическую и виртуальную среду».
В Европейском союзе в ходе очень динамичного развития регуляторики также идет поиск адекватной правовой дефиниции5. В настоящее время Регламент Европейского союза об искусственном интеллекте 2024 года (Закон об искусственном интеллекте, AI Act) содержит следующее определение: «”Система искусственного интеллекта” означает машинную систему, которая разработана для работы с различным уровнем автономности, и может демонстрировать адаптивность после развертывания, и которая для достижения явных или неявных целей делает выводы на основе получаемых ею входных данных о том, как генерировать выходные данные, такие как прогнозы, контент, рекомендации или решения, которые могут влиять на физическую или виртуальную среду» (п. 1 ст. 3 Регламента)1. Это определение соответствует тому, которое было дано в статье 2 Рамочной конвенции Совета Европы об искусственном интеллекте, правах человека, демократии и верховенстве права, принятой месяцем ранее2.
Модель искусственного интеллекта общего назначения , согласно статье 3 Закона об искусственном интеллекте, – модель ИИ (в том числе обученная с использованием большого объема данных и самоконтроля в масштабе), которая демонстрирует значительную общность и способна компетентно выполнять широкий спектр различных задач независимо от способа размещения модели на рынке и которая может быть интегрирована в различные нисходящие системы или приложения, за исключением моделей ИИ, используемых для исследований, разработок или создания прототипов до их размещения на рынке.
Тем не менее не утрачивает актуальности оценка существующей ситуации, произведенная И. А. Филиповой, которая полагает, что отсутствие устраивающего всех определения понятия «искусственный интеллект» вызывает сложности и с формулированием легальной дефиниции [25].
В литературе предлагается различать модели искусственного интеллекта и системы искусственного интеллекта. Модели являются частью систем ИИ (которые в российских источниках чаще определяют как специальные программы для ЭВМ); для систем необходимо добавление дополнительных компонентов, например пользовательского интер-фейса3.
Обучение искусственного интеллекта. Практически все попытки определить соответствующие технологии и системы указывают на наличие и важность механизмов обучения искусственного интеллекта – процесса, направленного на наполнение системы данными, позволяющими ей находить (вычислять) закономерности для того, чтобы на их основе создавать новые данные.
В российском праве можно найти упоминания об этих процессах. Так, Указ Президента РФ № 490 определяет особенности машинного обучения искусственного интеллекта, к которым относится введение репрезентативного, релевантного и корректно размеченного набора данных для поиска вычислительной системой непредвзятого решения, но при этом результаты «работы» искусственного интеллекта часто крайне сложны для интерпретации, могут быть подвергнуты сомнению и отменены человеком.
Методы обучения ИИ . Вопросы обучения систем искусственного интеллекта, то есть фактически наполнения данными для обработки, на сегодняшний день не менее важны, чем вопросы правового режима объектов, им создаваемых, и требуют изучения на уровне междисциплинарного исследования с учетом опыта зарубежных стран.
Обучение искусственного интеллекта представляет собой процесс, в ходе которого система искусственного интеллекта учится выполнять определенные задачи, основываясь на наборе данных и правил. Для этого применяются различные методы и алгоритмы, которые позволяют машине извлекать знания из данных и использовать их для принятия решений, а именно:
-
• метод обучения с учителем (Supervised Learning) – представляет собой метод, при котором для обучения машины используются данные с метками (например, классифицированные изображения), применяется в задачах классификации, регрессии и прогнозирования;
-
• метод обучения без учителя (Unsupervised Learning) – это метод, при котором искусственный интеллект обучается выявлять закономерности и скрытые взаимосвязи на наборах неразмеченных данных без контроля со стороны пользователя, применяется для выявления структуры в данных, обнаружения аномалий и сжатия данных;
-
• метод активного обучения (Active Learning) – это метод, в котором искусственный интеллект сам выбирает данные для обучения, исходя из своих текущих знаний, применяется для экономии времени и ресурсов на сбор и обработку данных;
-
• метод глубокого обучения (Deep Learning) – выступает подвидом машинного обучения, основанного на искусственных нейронных сетях. Глубокое обучение позволяет машине изучать сложные функции и взаимосвязи в больших объемах данных. Оно применяется в таких задачах, как распознавание речи, распознавание лиц и обработка естественного языка.
Выбор метода зависит от типа задачи, объема данных и доступных ресурсов и не ограничивается обозначенными выше видами.
С точки зрения определения цели разработки и наполнения системы следует учитывать, что технологии искусственного интеллекта представляют собой совокупность технологий, включающую в себя:
-
– технологии обработки визуальных данных, включая компьютерное зрение;
-
– технологии обработки звуковых данных, включая распознавание и синтез речи;
-
– технологии обработки текста;
-
– технологии интеллектуальной поддержки принятия решений и управления.
В рамках процесса «обучения» искусственного интеллекта выделяют следующие этапы.
-
1. Сбор данных.
-
2. Очистка и подготовка данных (приведение данных к единому формату, в частности выражение на машинном языке).
-
3. Выбор архитектуры модели (определение подходящей структуры нейронной сети в зависимости от задачи).
-
4. Настройка гиперпараметров (оптимизация параметров обучения: скорость обучения, количество слоев и др.).
-
5. Обучение и валидация (разделение данных на тренировочные и валидационные наборы, определение метрики точности и предотвращения переобучения).
-
6. Тестирование (проведение оценки модели на независимом тестовом наборе данных для подтверждения ее эффективности).
-
7. Развертывание (интеграция обученной модели в конечную систему, обеспечение ее стабильной работы и возможности обновления)1.
Каждый из этапов обучения искусственного интеллекта имеет определенные особенности.
Для рассматриваемых целей могут использоваться различные базы данных, несистематизированная информация, охраняемые объекты интеллектуальных прав, неохраняемые результаты творческой деятельности, персональные данные, различные инструменты, такие как ChatGPT, CustomGPT.ai, MindStudio и др. Многие платформы используют запросы пользователей как самостоятельные элементы обучения искусственного интеллекта (BingImageCreator; ChatGPT, Picfinder).
Как отмечалось, технологии искусственного интеллекта основаны на анализе и использовании огромного массива данных, в том числе включающего охраняемые результаты интеллектуальной деятельности. Особенно активно такие результаты используются в системах, функционал которых обеспечивает создание объектов, традиционно рассматриваемых в качестве произведений (текст, изображение, музыка и т. д.). Некоторые системы построены на обучении и генерировании собственных результатов на основе конкретных произведений, выбранных пользователем [29].
Использование охраняемых результатов интеллектуальной деятельности для целей обучения ИИ вызывает озабоченность не только у правообладателей, но и у широкого круга лиц, опасающихся негативного воздействия такого использования на сферу творческой деятельности.
Так, Илон Маск, Стив Возняк и еще более тысячи «гуру» в области IT-технологий выступили с открытым письмом, призвав приостановить обучение искусственного интеллекта (ИИ). Поводом для беспокойства стал чат-бот ChatGPT, созданный на основе ИИ, который способен вести диалог, сочинять стихи, писать сценарии, спорить, создавать код программирования. Нейросеть может также производить финансовый анализ, делать внятные (то есть с пониманием дела) резюме технических статей и научных концепций, давать всевозможные прогнозы и персональные (персонифицированные, главное) советы, в том числе этические, хотя этика была до сих пор недоступна ИИ в принципе2.
Многие писатели, художники, разработчики программного кода жалуются на «беспрецедентное пиратство» в процессе обучения нейросетей на примере загружаемых в них охраняемых объектов авторских прав, без согласия и без выплаты соответствующего вознаграждения правообладателям. По мнению последних, разработчики искусственного интеллекта, преследуя свои коммерческие цели, совершенно игнорируют коммерческие интересы правообладателей, что заставляет последних инициировать судебные споры (см. далее).
С целью исключения ситуаций несанкционированного использования контента, размещенного в интернете, некоторые крупные интернет-ресурсы и издательские дома, в частности в США, вводят запреты на индексирование своих веб-сайтов, что побуждает компании, работающие над созданием систем ИИ, заключать с ними соглашения, предусматривающие плату за использование содержащихся на сайтах материалов.
Наиболее уязвимы к воздействию для целей обучения ИИ-объекты, охраняемые авторским и смежными правами. Однако кроме них могут использоваться и данные об объектах патентного права (изобретения, полезные модели, промышленные образцы). Одним из примеров является известная технология DABUS (Device for Autonomous Bootstrapping of Unified Sentience), способная создавать патентоспособные технические решения [3]. Обучение подобных систем связано с использованием сведений, содержащихся в патентной документации охраняемых объектов.
Характеристика использования охраняемых объектов авторских и смежных прав в процессе машинного обучения
Согласно действующему российскому законодательству (ст. 1229, 1270 Гражданского кодекса РФ (далее – ГК РФ)) любое использование охраняемого объекта авторского права может осуществляться только с согласия обладателя исключительного права независимо от цели и способов использования; отсутствие запрета само по себе не считается согласием. Согласие правообладателя необходимо и для использования любым способом исполнений, фонограмм, сообщений радио- и телепередач, баз данных в части охраны их содержания (ст. 1317, 1324, 1330, 1334 ГК РФ).
Необходимость получения согласия правообладателя в отношении объектов авторского и смежных прав отсутствует только в случаях, прямо установленных законом (свободное использование, использование без согласия правообладателя, но с выплатой вознаграждения, специальные случаи, установленные в отношении использования программ для ЭВМ). Следовательно, использование таких объектов для машинного обучения без согласия правообладателя в случаях, не охватываемых специальными правилами, является нарушением его прав.
Согласно пункту 7 статьи 1259 ГК РФ использование части произведения без согласия правообладателя также может привести к нарушению исключительного права, если эта часть по своему характеру может быть признана самостоятельным результатом творческого труда автора. Ответ на вопрос о том, подпадают ли процессы, осуществляемые в ходе обучения ИИ, под данное исключение, зависит от характера используемой технологии. В ходе машинного обучения как части технологии ИИ обычно происходит копирование охраняемых объектов (текстов, изображений и т. д.) для их предварительной обработки. Соответственно, если речь идет об объектах, изначально существующих в материальной форме, они должны быть предварительно оцифрованы. Оцифрованные объекты обрабатываются таким образом, чтобы их можно было использовать в процессе обучения: необходимо их разделение на фрагменты, разметка («токенизация») и т. д. Для этого чаще требуется их копирование из исходных файлов и запись на иное компьютерное устройство.
В соответствии с подпунктом 1 пункта 2 статьи 1270 ГК РФ запись произведения на электронном носителе, в том числе запись в память ЭВМ, считается воспроизведением. «Признание записи на электронном носителе разновидностью воспроизведения имеет большое практическое значение. Это позволяет автору или иному правообладателю осуществлять контроль за любым использованием произведения в электронной форме, а также в информационно-телекоммуникационных сетях» [18].
Вместе с тем в соответствии с той же нормой не считается воспроизведением краткосрочная запись произведения, которая: носит временный или случайный характер, составляет неотъемлемую и существенную часть технологического процесса, имеющего единственной целью правомерное использование произведения либо осуществляемую информационным посредником между третьими лицами передачу произведения в информационно-телекоммуникационной сети, при условии, что такая запись не имеет самостоятельного экономического значения.
В известных практике случаях производимые разработчиками записи произведений не носили случайного характера и чаще всего сохранялись достаточно длительное время, чтобы использоваться для дальнейшего анализа. Например, в судебных спорах, рассматриваемых в Европейском союзе, ответчики фактически не спорили с фактом того, что при осуществлении TDM имело место воспроизведение объекта, не ссылаясь на исключение для временных записей (см. дело LAION).
В ряде случаев воспроизведение на этапах анализа данных, обусловленное технологическими особенностями, может быть временным или случайным. Однако для того, чтобы исключение, предусмотренное подпунктом 1 пункта 2 статьи 1270 ГК РФ, было применено, необходимо также, чтобы такая запись была произведена с единственной целью правомерного использования произведения, что в рассматриваемых ситуациях, когда извлечение данных, их последующее использование производится без согласия правообладателя и не направлено на правомерное использование произведения, весьма проблематично.
Необходимо также, чтобы создание временных технических копий не имело самостоятельного экономического значения. В ситуации, когда лицо использует данные в коммерческих целях для создания нового технологического продукта, выгода от использования произведения явно выходит за рамки ожидаемой от обычного использования произведений, на которых обучаются модели ИИ.
Вместе с тем возможен и иной подход, рассматривающий процесс воспроизведения объектов как часть технического процесса анализа текста, всегда носящего временный характер и не нацеленного на использование произведения как такового.
Один из возможных аргументов, направленных на опровержение факта использования объекта авторских прав, может быть основан на идее, отраженной в пункте 3 статьи 1270 ГК РФ: не является использованием «практическое применение положений, составляющих содержание произведения, в том числе положений, представляющих собой техническое, экономическое, организационное или иное решение». Данная норма учитывает необходимость разграничения формы произведения (которая подлежит охране) и заложенного в ней содержания – идей, концепций, решений и т. д. (которые охране не подлежат).
При загрузке материалов, включающих охраняемые объекты, в компьютерное устройство возникает вопрос о том, используется ли форма произведения, ведь сами загружаемые объекты не будут доступны человеку, информация о них загружается для машинной обработки, разбивки на фрагменты, размещения меток и т. д., что дает основание утверждать, что использования произведения как такового не происходит. Кстати, именно такая идея лежала в основе подхода, существовавшего в правовой системе Японии (см. далее).
Практики применения данных норм российскими судами в отношении ситуации использования охраняемых авторским правом произведений нет, поэтому возможное их толкование остается вопросом, требующим обсуждения.
Поскольку при обработке исходных объектов происходит их разделение на фрагменты, удобные для дальнейшей обработки в процессе машинного обучения, возникает вопрос о возможности квалификации этих действий в качестве переработки произведений. Под переработкой понимается создание производного произведения (ст. 1260 ГК).
В случае переработки создается новый объект авторского права. Если изменения вносятся в само оригинальное произведение (сокращение, разбивка на фрагменты, изменение формата фотографии1), то предварительная разбивка и разметка используемых объектов не является переработкой. Не затрагивается в данном случае и личное неимущественное право на неприкосновенность произведения (ст. 1266 ГК), поскольку полученные результаты носят технический характер и в принципе не предназначены для человеческого восприятия.
В отношении программы для ЭВМ и базы данных под переработкой понимается их модификация, включающая любые изменения, включая их перевод с одного языка на другой (под которыми понимаются в том числе языки программирования). На этапе подготовки данных для машинного обучения производных объектов не создается, соответственно, данный процесс не является переработкой.
В отношении использования баз данных , охраняемых в качестве объектов смежных прав, пункт 1 статьи 1334 ГК РФ предусматривает, что ее изготовителю принадлежит исключительное право извлекать из базы данных материалы и осуществлять их последующее использование в любой форме и любым способом (исключительное право изготовителя базы данных).
Никто не вправе извлекать из базы данных материалы и осуществлять их последующее использование без разрешения правообладателя, кроме предусмотренных законом случаев.
Под извлечением материалов ГК РФ понимает перенос всего содержания базы данных или существенной части составляющих ее материалов на другой информационный носитель с использованием любых технических средств и в любой форме.
Как отмечает О. В. Калятин, при извлечении «создается не копия базы данных, а осуществляется заимствование содержащихся в ней материалов. Поэтому не будет иметь значение ни формат сохранения соответствующих материалов, ни их взаимное расположение на новом носителе» [10].
Источником получения данных для машинного обучения являются в том числе охраняемые базы данных, из которых могут извлекаться материалы; объем извлечения может быть существенным [10]. Если эти извлеченные данные используются для обработки, разметки и дальнейшего анализа программой, возникает вопрос о том, могут ли такие действия охватываться понятием «использование». Согласно существующему в настоящее время подходу понятие использования трактуется достаточно широко. Поэтому указанные действия при отсутствии согласия правообладателя по общему правилу представляют собой нарушение его прав.
Вместе с тем, в отличие от объектов авторского и смежного права, использование описания изобретения, полезной модели или промышленного образца в произведении науки, литературы и искусства исключительным правом правообладателя не охватывается2.
В соответствии с положениями статьи 1358 ГК РФ использованием изобретения, полезной модели, промышленного образца считаются действия, связанные с их использованием непосредственно в продукте, способе или изделии (ввоз на территорию Российской Федерации, изготовление, применение, предложение к продаже, продажа, иное введение в гражданский оборот или хранение для этих целей). В связи с этим воспроизведение патентной документации, внешнего вида изделия для обучения ИИ не является нарушением исключительного права автора или патентообладателя объектов патентного права.
Подход Европейского союза к вопросу использования объектов авторских и смежных прав для обучения ИИ является достаточно жестким.
Положения Директивы 2019/790/ЕС от 17 апреля 2019 г. «Об авторском праве и смежных правах в рамках единого цифрового рынка и о внесении изменений в Директивы 96/9/EC и 2001/29/EC» (далее – Директива CDSM)1 регулируют отдельные аспекты деятельности, связанной с text and data mining (TDM) – интеллектуальным (глубоким) анализом текста и данных. Важное значение имеет Директива 2001/29/ЕС2, обычно именуемая Директивой «Информационное общество», а также Закон ЕС об искусственном интеллекте (AI Act)3.
Статья 2 Директивы CDSM устанавливает исключительное право на воспроизведение, которым пользуются авторы в отношении своих произведений, защищенных авторским правом, а также конкретные бенефициары смежных прав. Воспроизведение любого произведения (или объекта, охраняемого смежным правом) требует разрешения, независимо от того, является ли воспроизведение временным или постоянным, от способа или формы производства, а также от того, является ли воспроизведение полным или частичным.
Для баз данных, защищенных авторским правом, Директива 96/9/ЕС (Директива о базе данных)4 устанавливает, что их авторы имеют исключительные права разрешать воспроизведение своих баз данных, независимо от того, являются ли такие воспроизведения временными или постоянными. В отношении баз данных, защищаемых sui generis, создатель базы имеет право предотвращать извлечение и/или повторное использование всего (или существенной части, оцененной качественно и/или количественно) содержания этой базы данных.
В соответствии с частью 2 статьи 7 Директивы 96/9/EC под извлечением понимается постоянная или временная передача всего или существенной части содержимого базы данных на другой носитель любыми средствами или в любой форме, а под использованием – любая форма публичного предоставления всего или существенной части содержимого базы данных распространением копий, сдачей в аренду, интерактивно или другими формами передачи. Извлечение и/или повторное использование «несущественной части» в целом допустимо, что актуально для веб-скрейпинга, автоматизированного извлечения информации из общедоступных веб-сайтов и веб-страниц.
Законодательство ЕС очень широко определяет содержание исключительного права правообладателя. Для того чтобы действия не рассматривались как нарушающие исключительное право, они должны быть конкретно указаны. Это в полной мере касается и действий, направленных на извлечение и анализ данных, в том числе рассматриваемых в качестве объекта охраны в рамках права интеллектуальной собственности.
Директива CDSM (ст. 2) дает определение технологии изучения текста и данных (TDM): «Любая автоматизированная аналитическая методика, направленная на анализ текста и данных в цифровой форме с целью получения информации, которая включает, помимо прочего, закономерности, тенденции и корреляции». Она может включать воспроизведение защищенных произведений, что требует разрешения от правообладателей, если не применяется конкретное исключение или ограничение.
Директива CDSM прямо признает, что временное исключение для воспроизведения может применяться в контексте использования TDM. В соответствии с пунктом 9 Директивы временное исключение для воспроизведения должно применяться к технологиям TDM, которые не предполагают изготовление копий за пределами сферы действия этого исключения. Вместе с тем в Директиве также отмечается, что юридически может возникнуть неопределенность в контексте того, соответствует ли использование TDM всем требованиям для временного исключения для воспроизведения.
Суд Европейского союза в ряде дел определил критерии допустимого временного воспроизведе-ния5 (см. с. 50), но в этих делах не рассматривались исключения для временного воспроизведения применительно к обучению ИИ.
Директива CDSM была принята до активного обсуждения проблемы обучения ИИ, что вызвало дискуссию о возможности распространения ее положений об исключениях на случаи анализа текста и данных в рамках методов обучения ИИ. Распространение ее положений на ситуации обучения ИИ основывается в том числе на статье 51(1) (с) Закона об искусственном интеллекте (AI Act), которая требует, чтобы универсальные модели ИИ соответствовали резервированию CDSM для TDM. В европейской доктрине, несмотря на некоторые колебания1, в целом признается, что методики машинного обучения, которые используются для обучения систем искусственного интеллекта, подпадают под понятие text and data mining (TDM).
В США подход к регулированию отношений, возникающих при использовании охраняемых объектов авторских и смежных прав для обучения искусственного интеллекта, отличается большей лояльностью. Такое использование чаще всего рассматривается как добросовестное на основании доктрины fair use (добросовестного использования), которая разрешает ограниченное использование объектов авторского права без разрешения правообладателя в случаях, когда произведение используется в некоммерческих, образовательных, научных, критических, пародийных целях, небольшой объем копирования (но иногда даже небольшой объем копирования, если речь идет о ключевой части, может быть признан нарушением). Использование не должно наносить ущерб потенциальному рынку оригинала, при наличии такого ущерба использование не может быть признано добросовестным.
Вместе с тем использование этой доктрины к ситуациям, связанным с обучением нейросетей, особенно для создания изображений и видео, вызывает определенные сомнения, поскольку разработчики систем искусственного интеллекта по существу оказываются на одном товарном рынке с правообладателями, а распространяемый сгенерированный контент вытесняет их с рынка. Еще один аспект использования этой доктрины заключается в отсутствии правовой возможности потребовать от разработчиков систем искусственного интеллекта вознаграждения на использование охраняемых объектов авторского и смежных прав.
Преимущества доктрины fair use состоят в ее гибкости, которая позволяет без труда адаптировать ее к изменяющимся условиям. Но эта гибкость одновременно является и недостатком, поскольку не создает определенного правила, как это сделано в европейском праве, и судебная практика может сильно колебаться в оценке обстоятельств дел.
Ключевым юридическим вопросом является толкование «копии» в соответствии с Законом США об авторском праве2. Интерпретация этого термина в контексте разработки моделей искусственного интеллекта может оказать существенное влияние на ответственность моделей ИИ. Широкое толкование может привести к тому, что модель ИИ будет считаться
«копией». Как следствие, нарушение может возникнуть не только в результате несанкционированного воспроизведения, но и в результате несанкционированного распространения (когда модель используется в коммерческих целях).
Обязательства по раскрытию данных об обучении моделей ИИ широко обсуждаются в США. Этому вопросу посвящены по крайней мере два законодательных предложения – Закон о прозрачности модели Фонда ИИ 2023 года (Представитель Байер, 2023 г.) и Закон о раскрытии авторских прав на генеративный ИИ 2024 (Депутат Шифф, 2024 г.). Существуют также законы на уровне законодательных органов штатов, например, законопроект Калифорнии АВ-2013 «Генеративный искусственный интеллект: прозрачность данных обучения», который был принят и вступил в силу в январе 2026 года3.
Судебная практика последних лет в США стандартно применяет к спорным ситуациям положения доктрины добросовестного использования и достаточно часто признает ответчика действующим добросовестно. Так, в деле Bartz против Anthropic PBC. (США. Северный округ Калифорнии) суд пришел к выводу, что использование компанией Anthropic книг авторов для обучения языковых моделей было добросовестным. В частности, анализируя такой критерий добросовестности, как влияние на конкуренцию, суд установил, что он указывал на добросовестное использование, поскольку:
-
1) обучение языковых моделей не привело к снижению спроса на произведения авторов и не предоставило общественности каких-либо заменяющих копий;
-
2) любая общая конкуренция со стороны произведений, созданных с помощью искусственного интеллекта, не является тем видом творческого вытеснения, которое стремится предотвратить Закон об авторском праве;
-
3) даже если предположить, что существует развивающийся рынок лицензирования произведений, охраняемых авторским правом, для обучения языковых моделей, устранение такого рынка не является той потерей, предотвращение которой входит в цели Закона об авторском праве4.
Таким образом, в странах, применяющих доктрину добросовестного использования, для констатации нарушения исключительных прав при обучении ИИ необходимо установить, имело ли место «копирование», а далее – соответствуют ли действия ответчика стандарту добросовестности.
Еще один аспект был затронут при рассмотрении коллективного иска против Microsoft и ее дочерних компаний GitHub и OpenAI, которые являются разработчиками GitHubCopilot – инструмента для автодополнения кода в нескольких средах разработки, которые обучали свои системы ИИ в общедоступных репозиториях GitHub, чем нарушили права авторов, разместивших код или работы под определенными лицензиями с открытым исходным кодом на GitHub, каждая из которых требует указания имени автора и соблюдения других личных неимущественных прав, включая лицензию MIT, GPL и лицензию Apache1 . В иске было отказано, поскольку истцы не смогли доказать, что их код был в точности воспроизведен, что рассматривается в СМИ как «победа» платформ в вопросах обучения искусственного интеллекта. Однако отмечается, что, несмотря на вынесенное решение, действия ответчиков по существу нарушают параграф 1202 DMCA, который запрещает удаление информации об управлении авторскими правами, а также Договор ВОИС 1996 года об авторском праве.
Определенные элементы правового регулирования обучения ИИ сложились в Китайской Народной Республике . 15 августа 2023 г. вступили в силу Временные меры по управлению услугами генеративного искусственного интеллекта, сформулированные в соответствии с Законом КНР о кибербезопасности, Законом КНР о безопасности данных, Законом КНР о защите личной информации, Законом КНР о научно-техническом прогрессе. В числе основных целей регулирования названы уважение права интеллектуальной собственности и деловой этики, обеспечение коммерческой тайны, неиспользование таких преимуществ, как алгоритмы, данные и платформы, для участия в монополии и недобросовестной конкуренции.
В соответствии со статьей 7 Временных мер поставщики услуг генеративного ИИ должны осуществлять мероприятия по обработке данных обучения, такие как предварительное обучение и оптимизационное обучение, в соответствии с законом и соблюдать следующие положения:
-
1) необходимо использовать данные и базовые модели из законных источников;
-
2) в случаях, когда затрагиваются права интеллектуальной собственности, не должны нарушаться права интеллектуальной собственности, которыми пользуются другие лица в соответствии с законом;
-
3) в случае использования персональных данных необходимо получить согласие лица или соблюсти другие обстоятельства, предусмотренные законами и административными правилами2.
Своеобразный подход демонстрирует Япония, где еще в 2009 году Закон3 допустил возможность свободного использования объектов интеллектуальной собственности для TDM, независимо от наличия научной или исследовательской цели. Впоследствии возможности использования технологии TDM были значительно расширены. В статье 30-4 Закона предусматривается, что разрешается использовать произведение любым способом в той мере, в какой это считается необходимым, в любом из следующих случаев или в любом другом случае, когда целью не является наслаждение (англ. enjoying) формами выражения мыслей и мнений, содержащихся в произведении; «…положения этой статьи не применяются, если использование будет необоснованно ущемлять интересы автора».
Использованием формы выражения закон считает любую обработку без восприятия данных органами чувств человека, в том числе обработку машинными средствами, включая TDM.
Принятие этой статьи, согласно разъяснению Japan Copyright Office (JCO), обосновывается тем, что экономическая ценность произведения выражается в том, что человек платит вознаграждение автору за то, чтобы насладиться формами выражения идей и эмоций, содержащимися в работе, поэтому все действия, не связанные с этим, не могут нарушить права автора, охраняемые законом4.
Вместе с тем Агентство по делам культуры при Министерстве образования, культуры, спорта, науки и технологий Японии разъяснило [18], что на этапе создания и использования синтетического контента решение о нарушении авторских прав при загрузке и публикации изображений, созданных искусственным интеллектом, а также при ином их коммерческом использовании рассматривается так же, как и обычное нарушение авторских прав, за исключением случаев, когда использование разрешено в соответствии с законодательством об авторском праве. Прежде всего, это касается ситуаций, возникающих «на выходе», когда сгенерированный контент похож на оригинальный объект, защищенный авторским правом; такие ситуации свидетельствуют о нарушении прав правообладателя.
Таким образом, краткий обзор подходов в различных правовых системах показывает, что как в случае принятия специальных правил, направленных на регулирование процессов обучения систем ИИ, так и при применении к этим ситуациям уже сложившихся правил признается, что в процессе извлечения и обработки данных для рассматриваемых целей могут нарушаться исключительные права правообладателей произведений науки, литературы и искусства, программ для ЭВМ и баз данных. Такие нарушения чаще всего связаны с несанкционированным копированием (воспроизведением) охраняемых произведений на начальных стадиях подготовки материалов для обучения, а также с извлечением существенной части материалов из охраняемых баз данных. В ряде случаев нарушения могут быть связаны с удалением защитной информации и данных об авторе.
Необходимо отметить, что ситуации создания в результате работы систем ИИ результатов, воспроизводящих форму заложенных объектов, требуют самостоятельного рассмотрения.
Проблему нарушения авторских прав в результате работы системы ИИ, обученной на определенных объектах, иллюстрирует дело, рассмотренное в Китае.
Суд вынес решение на основании Закона об авторском праве Китайской Народной Республики и Временных мер по администрированию услуг искусственного интеллекта, изданных в августе 2023 года Управлением киберпространства КНР. Суд установил, что изображения, созданные ИИ, были похожи на защищенные авторским правом особенности персонажа Ультрамена, что представляет собой несанкционированное воспроизведение и адаптацию. Однако суд решил не оценивать нарушение прав на сетевое распространение, поскольку два других права адекватно решали проблему нарушения.
Ответчик был признан «поставщиком услуг генеративного ИИ» в соответствии со статьей 22(2) Временных мер и привлечен к ответственности. Суд установил, что фильтры ключевых слов, внедренные ответчиком для предотвращения создания противоправного контента, были недостаточными, пользователи всё равно могли генерировать изображения, похожие на Ультрамена, используя альтернативные подсказки. Суд обязал ответчика принять более надежные профилактические меры. Вместе с тем суд отклонил ходатайство истца об удалении материалов, защищенных авторским правом, из набора данных для обучения ввиду недостаточности доказательств участия ответчика в обучении модели.
Суд подчеркнул важность прозрачных методов ИИ для защиты интеллектуальной собственности и осведомленности пользователей. Эти недостатки были приведены в качестве основания для присуждения истцу компенсации за экономические потери и расходы на принудительное исполнение.
Хотя суд и привлек компанию ИИ к ответственности, он одновременно признал проблему обеспечения баланса между защитой авторских прав и разработкой ИИ. Суд воздержался от рассмотрения вопроса о том, является ли использование защищенных авторским правом материалов для обучения ИИ нарушением. Суд признал, что такое определение может несоразмерно затруднить деятельность по созданию искусственного интеллекта, и в своем решении сосредоточил внимание на создании контента (выход), а не на процессе обучения (вход).
Другой пример предполагаемого нарушения на этапе «входа», где анализируется контент, генерируемый на этапе «выхода», – дело Gema против Suno AI (Германия). Компания GEMA в январе 2025 года объявила, что подала иск против поставщика генеративного искусственного интеллекта, американской компании Suno AI, которая разработала инструмент для создания аудиоконтента, генерируемого ИИ. В своем пресс-релизе1 истец заявил, что иск основан на доказательствах, свидетельствующих о том, что предлагаемый ответчиком продукт может быть использован для синтезирования песен, которые очень похожи с точки зрения мелодии, гармонии и ритма на произведения, правообладателем которых является истец. Доказательства, представленные в суд, включали известные песни и сравнение некоторых из них с аналогами, сгенерированными с помощью ИИ.
Истец утверждал, что ответчик без согласия истца использовал музыкальные произведения в двух целях – обучение своего продукта для создания музыки и создание результатов, генерируемых ИИ. Истец ссылается на заявления, сделанные ответчиком в ходе судебного разбирательства в США, где компания призналась в использовании «практически всего, что доступно в Интернете». В качестве одного из доказательств несанкционированного использования истец ссылался на факт создания «сходного до степени смешения контента». В итоге GEMA выиграла дело против OpenAI из-за нелицензионного использования текстов песен в ChatGPT, создав прецедент в области авторского права в сфере ИИ по всей Европе.
Представляется своевременным определение позиции в части защиты авторских прав при использовании охраняемых произведений при обучении искусственного интеллекта на уровне Всемирной организации интеллектуальной собственности. Попытки решения вопроса были предприняты еще в 2020 году при проведении II раунда Дискуссии Всемирной организации интеллектуальной собственности по вопросам интеллектуальной собственности и искусственного интеллекта. Были высказаны разные позиции. Так, представители платформ (организация Creative Commons) приводили доводы в пользу того, что использование охраняемой информации для целей обучения искусственного интеллекта не должно квалифицироваться как нарушение прав автора [23], с учетом специфики использования, некоммерческого характера и др. Однако ВОИС, судя по всему, заняла иную позицию. В Докладе ВОИС1 отмечается важность того, чтобы «правила авторского права работали таким образом, чтобы сохранять контроль за человеческими создателями и обеспечивать их надлежащее вознаграждение, одновременно позволяя разработчикам ИИ всех размеров иметь конкурентный доступ к качественным данным. Балансировка интересов обеих сторон может быть облегчена простыми и эффективными механизмами для правообладателя по резервированию их прав и использования их контента, а также механизмами лицензирования и медиации, чтобы способствовать заключению лицензионных соглашений с разработчиками ИИ».
Свободное использование объектов в контексте обучения искусственного интеллекта
Специальные положения, касающиеся свободного использования охраняемых авторским и смежными правами результатов для целей обучения ИИ, в российском праве отсутствуют.
ГК РФ предусматривает ряд случаев свободного использования, которые могут быть рассмотрены с точки зрения возможности их учета для оценки действий, связанных с применением технологий извлечения и обработки больших данных, используемых для обучения ИИ.
В соответствии со статьей 1274 ГК РФ допускается без согласия автора или иного правообладателя и без выплаты вознаграждения, но с обязательным указанием имени автора, произведение которого используется, и источника заимствования использование произведения в информационных, научных или культурных целях. Анализ положений данной статьи показывает, что для целей использования технологий анализа текстов и изображений в рамках машинного обучения может иметь значение лишь положение о пределах цитирования: «цитирование в оригинале и в переводе в научных, полемических, информационных, учебных целях, в целях раскрытия творческого замысла автора правомерно обнародованных произведений и объеме, оправданном целью цитирования…».
В литературе обоснованно отмечается, что рассматриваемая норма не конкретизирует применяемые технологии, «использование объектов авторских прав может осуществлять как при помощи технологий TDM, так и “вручную” человеком» [24].
Использование произведений в научных целях в ряде случаев вполне обоснованно, но, очевидно, не может автоматически признаваться только на том основании, что извлечение происходит для целей обучения ИИ. Аналогичное замечание можно сделать и в отношении учебной цели. С точки зрения российского права нет оснований рассматривать использование объектов авторских и смежных прав для обучения ИИ как использование в образовательных целях, которое также носит весьма ограниченный характер и по субъектному составу, и по объему. Несмотря на использование словосочетания «обучение ИИ», с расхожим мнением, что такие системы обучаются «как люди», невозможно согласиться. Гражданский кодекс под «обучением», очевидно, не имел в виду использование технологий, направленных на извлечение и анализ данных, необходимых для настройки систем ИИ.
Если использование в научных целях будет доказано, то следующим необходимым условием свободного использования является необходимость указывать автора произведения и источник заимствования. Технически это может быть обеспечено, хотя на сегодняшний день не является распространенной практикой.
Последний критерий – использование произведения в объеме, оправданном целью цитирования, – также подлежит проверке и оценке с учетом конкретных обстоятельств.
Таким образом, рассмотренный случай свободного использования может быть применен для технологий глубокого анализа данных для целей обучения ИИ, если этот процесс будет соответствовать критериям допустимого цитирования с точки зрения цели, объема, указания необходимых данных.
Для программ для ЭВМ критерии допустимого использования в процессе обучения определяются с учетом того, что авторские права на компьютерные программы охраняются как права на произведения литературы (ст. 1261 ГК РФ). Специфику данного объекта определяют особенности правовой охраны, предоставляя лицу, правомерно владеющему экземпляром программы для ЭВМ, право без разрешения автора или иного правообладателя и без выплаты дополнительного вознаграждения осуществлять, в частности, действия по изучению, исследованию или испытанию функционирования такой программы в целях определения идей и принципов, лежащих в основе любого элемента программы для ЭВМ, путем осуществления действий, предусмотренных подпунктом 1 пункта 1 статьи 1280 ГК РФ. К таким действиям относятся действия, необходимые для функционирования программы для ЭВМ, включая запись и хранение в памяти ЭВМ (одной ЭВМ или одного пользователя сети), внесение в программу для ЭВМ изменений исключительно в целях их функционирования на технических средствах пользователя, исправление явных ошибок, если иное не предусмотрено договором с правообладателем.
С точки зрения цели данной нормы, которая позволяет совершать запись и копирование исключительно для обеспечения функционирования исходной программы, в ситуации с записью для анализа данных для обучения ИИ нельзя говорить о правомерности поведения лица, копирующего программу и анализирующего ее с использованием машинных средств для этих целей. Аналогичное замечание можно сделать и в отношении такого действия, как декодирование программы.
В отношении иных допустимых способов использования программы для ЭВМ, предусмотренных статьей 1280 ГК РФ, сложно представить возможность их применения к ситуациям обучения ИИ. В любом случае необходимо учитывать положение пункта 4 данной статьи, предусматривающей, что применение положений о допустимом использовании не должно противоречить обычному использованию программы для ЭВМ и не должно ущемлять необоснованным образом законные интересы автора или иного правообладателя.
В отношении баз данных для определения того, в каких случаях базы данных могут использоваться без согласия правообладателя для целей обучения ИИ, необходимо рассмотреть случаи свободного использования таких объектов.
Статья 1335.1 ГК РФ предусматривает, что лицо, правомерно пользующееся обнародованной базой данных, вправе без разрешения правообладателя и в той мере, в которой такие действия не нарушают авторские права изготовителя базы данных и других лиц, извлекать из базы данных материалы и осуществлять их последующее использование:
-
– в целях, для которых база данных ему предоставлена, в любом объеме, если иное не предусмотрено договором;
-
– в личных, научных, образовательных целях в объеме, оправданном указанными целями;
-
– в иных целях в объеме, составляющем несущественную часть базы данных.
Использование материалов, извлеченных из базы данных, способом, предполагающим получение к ним доступа неограниченного круга лиц, должно сопровождаться указанием на базу данных, из которой эти материалы извлечены. Для оценки существенности в российской практике используют количественный критерий1.
В соответствии с пунктом 3 статьи 1335.1 ГК РФ не допускается неоднократное извлечение или использование материалов, составляющих несущественную часть базы данных, если такие действия, во-первых, противоречат нормальному использованию базы данных и, во-вторых, ущемляют необоснованным образом законные интересы изготовителя базы данных.
Необходимо принимать во внимание общее правило, в соответствии с которым ограничения исключительных прав на произведения науки, литературы или искусства либо на объекты смежных прав устанавливаются при условии, что они не противоречат обычному использованию и не ущемляют необоснованным образом законные интересы правообладателей. С учетом этого использование баз данных как объектов смежного права в контексте технологии анализа данных для целей обучения ИИ может нарушать исключительные права изготовителя базы данных, если будет установлено, что такое использование конкурирует со способами использования, с помощью которых правообладатель обычно извлекает коммерческую выгоду, поскольку это будет противоречить нормальному использованию базы данных.
В Европейском союзе предусмотрены специальные исключения, ограничивающие права правообладателей объектов авторского и ряда смежных прав, для целей изучения текстов и данных с использованием TDM; они предусмотрены статьями 3 и 4 Директивы CDSM.
Директива (п. 1 ст. 3) гарантирует право на воспроизведение и на извлечение информации из произведений и других объектов для целей глубокого анализа. Согласно статье 3 Директивы правообладатели не могут противостоять практике использования TDM, когда она осуществляется научно-исследовательскими организациями или учреждениями культурного наследия в целях научного исследования. TDM в соответствии со статьей 3 не может быть исключено или ограничено условиями договора, а государства-члены не могут для этих случаев устанавливать механизмы справедливой компенсации для правообладателей.
Статья 3 Директивы вводит исключения в отношении прав на воспроизведение правообладателей авторских прав, владельцев смежных прав, правообладателей баз данных, защищенных авторским правом, прав на извлечение и повторное использование баз данных sui generis, а также прав на воспроизведение и предоставление издателей онлайн-прессы.
В статье 4 Директивы содержится изъятие, не ограниченное научно-исследовательскими целями, но обусловленное другим обстоятельством – воспроизведение и извлечение данных возможно лишь в том случае, если правообладатель прямо не заявил о запрете на эту деятельность «надлежащим образом, в том числе машиночитаемыми способами для контента, публично доступного онлайн» (п. 3).
В соответствии со статьей 4 Директивы CDSM применение TDM допускается при условии, что использование контента «не было явно зарезервировано их правообладателями надлежащим образом, например, с помощью машиночитаемых средств в случае контента, размещенного в открытом доступе в Интернете»1. Данное исключение охватывает, помимо авторских прав, прав на базы данных и прав издателей, также право на воспроизведение и изменение компьютерных программ.
Оговорки о резервировании прав, упоминаемые в статье 4, называют оговорками об «отказе от TDM». Для сохранения прав на воспроизведение и извлечение от правообладателя требуется активное решение – заявление правообладателя об отступлении от общего разрешения на TDM. Директива, таким образом, предусматривает необходимость проверки наличия запрета правообладателя на использование аналитических методик в отношении принадлежащих ему объектов авторского права. Нельзя не отметить, что выполнение такого требование трудновыполнимо и затратно.
Статья 3 Директивы SDCM разрешает исследовательским организациям сохранять полученную посредством TDM копию работ для научно-исследовательских целей, включая проверку результатов исследований. Согласно статье 4 воспроизведенная информация может храниться «столько времени, сколько необходимо для целей TDM».
Исключение по статье 3 Директивы SDCM считается более широким из-за отсутствия необходимости учета потенциальных оговорок правообладателя и потому, что предусмотренное этой статьей исключение распространяется и на последующее сохранение воспроизведенных результатов.
Для применения всех названных исключений требуется, чтобы доступ к произведениям, в отношении которых осуществляется анализ, был получен на законном основании (lawful access)2. Пиратский контент в любом случае не может использоваться для TDM.
Практика судов Европейского союза отражает дискуссии, которые возникли вокруг толкования целого ряда положений директивы CDSМ. Относительно небольшое количество дел может быть связано с тем, что правообладатели возлагают надежды на успех регуляторной деятельности.
Кроме того, ряд возникших конфликтов был разрешен с использованием механизмов борьбы с недобросовестной конкуренцией. На это оказало влияние решение Французского антимонопольного органа (Autorite de la concurrence), принятое в марте 2025 года, в рамках которого компания Google была оштрафована на 250 млн евро за невыполнение ранее принятых обязательств в соответствии с решением от июня 2022 года. В своем ранее состоявшемся решении от марта 2024 года антимонопольный орган прямо указал, что система искусственного интеллекта Google «Bard» прошла обучение на основании контента, принадлежащего издателям прессы, без разрешения. Было также отмечено, что Google не предложила технического решения для агентств прессы и издателей, которое бы позволило отказаться от использования их контента, не влияя на отображение такого контента на других службах Google (поисковая система).
Один из первых вариантов судебного анализа спора в отношении исключений из режима TDM для коммерческих и научных исследований в соответствии с Директивой 2019 года об авторском праве на едином цифровом рынке (DSM) (EU 2019/790) содержится в решении от 24.09.2024 Гамбургского окружного суда Германии по делу Кешке против LAION3.
Суд вынес решение4 о воспроизведении защищенного авторским правом контента из Интернета в процессе создания набора обучающих данных для ИИ, а также о том, предоставляют ли исключения из авторского права для обработки текста и данных (TDM) законное разрешение на такое использование.
Ответчиком являлась LAION – немецкая некоммерческая организация, действующая на рынке наборов данных для обучения ИИ. Она предлагает базу данных более чем из 5 млрд пар «изображение – текст», которая сопоставляет гиперссылки изображений, общедоступных в Интернете, с текстовой информацией о содержании изображения. Ответчик извлек URL-адреса изображений из набора данных Common Crawl, загрузил эти изображения, провел проверку для подтверждения описаний изображений. Затем он отфильтровал изображения, текстовое описание которых не соответствовало в достаточной степени содержанию, повторно извлек информацию о месторасположении (URL) для создания нового набора данных, который представлял собой отфильтрованное, очищенное и структурированное подмножество набора данных Common Crawl, оптимизированное для обучения систем изображений генеративного искусственного интеллекта.
Истец, фотограф, предоставил фотобанку лицензию на защищенную авторским правом фотографию. Затем без разрешения истца эта фотография была загружена, проанализирована и включена в набор данных ответчика. На сайте фотоагентства были изложены положения и условия, запрещающие веб-скрапинг. Условия были сформулированы следующим образом: «Вам не разрешается – использовать автоматизированные программы, апплеты, ботов и т. п. для доступа к веб-сайту или любому его содержимому в любых целях, включая, только в качестве примера, загрузку контента, индексацию, извлечение или кэширование любого контента на веб-сайте».
Истец потребовал судебного запрета в отношении ответчика, чтобы тот не мог в будущем воспроизводить фотографию для создания наборов обучающих данных для ИИ.
Ответчик не оспаривал, что производил деятельность по воспроизведению произведений истца. Спор заключался в том, применялись ли к такой деятельности какие-либо конкретные ограничения авторского права, установленные Директивой DSCM, а именно: 1) имело ли место временное воспроизведение; 2) имело ли место коммерческое TDM и 3) имело ли место TDM для научных целей.
Суд установил, что использование произведений ответчиком не соответствовало определенным условиям. Воспроизведение не было случайным, поскольку удаление было осуществлено не «независимо от пользователя», а скорее из-за сознательного программирования ответчиком процесса анализа. Кроме того, поскольку изображения были загружены для анализа с помощью специального программного обеспечения, их загрузка была не просто процессом, который сопровождает проводимый анализ, а сознательным и активным действием по получению информации, которое предшествует анализу. Суд признал, что ответчик не может ссылаться на исключение о временном воспроизведении, поскольку это исключение не распространяется на воспроизведение фотографий для создания отфильтрованного, очищенного и обработанного набора данных для обучения ИИ; такое воспроизведение не соответствуют условиям «временного» и «переходного или случайного».
Суд констатировал, что деятельность ответчика подпадает под определение TDM. Процесс загрузки работ с целью их анализа путем сравнения с уже существующими описаниями (то есть с описательной информацией, изначально найденной в базе данных Common Crowl) подпадает под определение TDM, поскольку анализ проводился для извлечения информации о корреляциях.
Закон об авторском праве Германии воспроизводит в UrhG (пар. 60d) правило о научно-исследовательском TDM, содержащееся в статье 3 Директивы DSCM. Основываясь на этом, cуд постановил, что данное исключение из авторского права применимо и деятельность ответчика допустима как осуществляемая для научных целей, поскольку она фактически была направлена на получение новых знаний. Для соответствия этому критерию не обязательно было фактически получать какие-либо новые знания, достаточно было, чтобы действия были направлены на получение знаний на более позднем этапе. Кроме того, деятельность ответчика была признана подпадающей под правило об исключениях для научного TDM, поскольку его исследовательская деятельность носит некоммерческий характер: полученный набор данных размещался в открытом доступе бесплатно1.
Как мы видим, для юридической оценки генеративного ИИ суд условно выделил три операционных уровня: уровень входных данных, «черный ящик» (машинное/глубокое обучение) и уровень выходных данных. LAION создает и предоставляет наборы данных с открытым исходным кодом, которые бесплатно используются третьими сторонами в качестве обучающих данных для моделей генеративного ИИ. Набор данных LAION 5B состоит из описаний почти 6 млрд изображений и ссылок на общедоступные изображения в Интернете. Наборы данных не содержат самих изображений (или их репродукций), но для того, чтобы с помощью программного обеспечения проверить, соответствуют ли описания изображений связанным с ними изображениям, LAION пришлось загрузить изображения.
Суд не рассматривал вопрос об авторских правах на этапе «черного ящика» нейронной сети или на выходном уровне, коснувшись только начального уровня – загрузки материалов при создании набора обучающих данных, то есть анализа материала нейронной сетью на предмет закономерностей, связей, корреляций и вероятностей2.
Исключения для использования программ для ЭВМ в целях обучения ИИ . Согласно преимущественному подходу в рамках Европейского союза компьютерные программы охраняются как литературные произведения. Соответственно, исключения, в том числе исключения для TDM, применимые к воспроизведению произведений, защищенных авторским правом, в полной мере распространяются и на компьютерные программы. Кроме того, предусмотрены особые исключения, содержащиеся в Директиве о компьютерных программах, статья 5(3) которой устанавливает исключение для наблюдения, изучения или тестирования компьютерной программы, которое не может быть изменено контрактом и может иметь значение в контексте обучения моделей искусственного интеллекта.
Правообладатель базы данных, охраняемой в качестве объекта авторского права, может осуществлять все необходимые для доступа к содержанию базы данных действия, на совершение которых не требуется специальное разрешение ее автора.
Государства – члены ЕС могут установить исключения для использования открыто опубликованных баз данных. В соответствии с частью 2 статьи 6 Директивы 96/9/EC пользователи таких баз данных могут совершать извлечение и вторичное использование части базы данных в следующих случаях:
-
a) при воспроизведении в личных целях неэлектронной базы данных;
-
б) использовании исключительно для иллюстрирования в учебных и научных исследованиях, если при этом указывается источник и использование осуществляется в объеме, оправданном некоммерческой целью;
-
в) использовании в целях общественной безопасности или осуществления административного или судебного производства;
-
г) наличии иных ограничений, традиционно устанавливаемых национальным правом, и соблюдении при этом (a), (b) и (c).
В отношении баз данных, охраняемых sui generis, допускается использование несущественной части базы данных. Директива 96/9/EC (ч. 5 ст. 7) предусматривает, что неоднократное извлечение или повторное использование несущественной части базы данных не допускается, если такие действия противоречат нормальному использованию базы данных или ущемляют необоснованным образом интересы изготовителя.
Директива 96/9/EC (ст. 9) предоставляет государствам-членам право установить исключения для извлечения или повторного использования существенной части базы данных в случаях:
-
a) извлечения в частных целях неэлектронной базы данных;
-
б) извлечения в целях иллюстрации, обучения или научного исследования при указании источника и в степени, оправданной достижением некоммерческих целей;
-
в) извлечения и использования в целях публичной безопасности или в целях административной или судебной процедуры.
Если базы данных защищаются авторскими или смежными правами, то их использование регламентируется Директивой 96/9/EC и на них распространяются рассмотренные выше случаи свободного использования. Если же база данных не является объектом авторских или смежных прав, то ее использование может ограничиваться по усмотрению ее создателя с применением договорных механизмов, в том числе договора, заключаемого посредством получения согласия пользователя подчиняться условиям (правилам) использования веб-сайтов.
Дальнейшее регулирование может развиваться различным образом, в частности, возможно признание использования охраняемых авторским и смежными правами объектов для обучения систем ИИ одним из случаев свободного использования, с выплатой или без выплаты вознаграждения правообладателю. Одним из предложений является введение исключения из общего правила, требующего положительного согласия правообладателя на использование произведения, и установление презумпции подразумеваемого согласия в случаях использования для целей обучения ИИ . Несмотря на привлекательность такого решения, его практическая реализация с учетом огромного массива данных, применяемых для обучения, может создать значительные практические трудности.
Субъекты ответственности за нарушение интеллектуальных прав в процессе обучения систем ИИ
В процессе получения и использования данных, в том числе представляющих собой охраняемые объекты авторских и смежных прав, может участвовать несколько субъектов, выполняющих различные функции. Поэтому для определения того, кто именно будет нести ответственность за нарушение интеллектуальных прав, необходимо выявить этих субъектов, характер их действий и сферу их осуществления.
Наиболее подробно отношения между различными участниками отношений в цифровой среде, имеющими отношение к системам ИИ, урегулированы в ЕС в Законе об искусственном интеллекте. В нем, в частности, выделяются представленные ниже.
Провайдер как физическое или юридическое лицо, государственный орган, агентство или иная организация, которые разрабатывают систему ИИ либо модель ИИ общего назначения, или имеют разработанную систему ИИ либо модель ИИ общего назначения и размещают ее на рынке, или вводят систему ИИ в эксплуатацию под своим собственным именем либо товарным знаком, как за плату, так и бесплатно.
Поставщик нижестоящего звена как поставщик системы ИИ, включая систему ИИ общего пользования, которая интегрирует модель ИИ, независимо от того, предоставляется ли модель ИИ им самим и вертикально интегрирована или предоставляется другой организацией на основе договорных отношений.
Развертыватель – физическое или юридическое лицо, государственный орган, агентство или иной орган, использующий систему ИИ в рамках своих полномочий, за исключением случаев, когда система ИИ применяется в ходе личной непрофессиональной деятельности.
Системы могут использоваться физическими лицами для генерации контента, и такие физические лица могут быть описаны как конечный пользователь .
Различия между поставщиком и разработчиком важны, поскольку они влияют на распределение юридической ответственности.
Помимо этого, в цепочки создания систем ИИ могут быть включены субъекты, осуществляющие предварительную подготовку информации для ее дальнейшего использования (разбивка на фрагменты, разметка, токенизация и т. д.). Например, компания Data Light предлагает услуги по сбору данных для машинного обучения1, компания Bright Data формирует платформу веб-данных, содержащую готовые наборы данных для широкого круга задач2, Datarade представляет систему поиска данных среди 500 поставщиков по всему миру, предлагает дата-сеты для машинного обучения и ИИ-проектов3. Такие субъекты могут действовать по поручению разработчиков ИИ либо самостоятельно, предоставляя последним готовые наборы данных.
Поскольку на настоящий момент нарушения интеллектуальных прав чаще всего связаны с этапом загрузки данных, включающих защищенные авторским правом объекты, то в качестве нарушителей прежде всего рассматривают тех субъектов, которые ее осуществляет. Так произошло в дело Кешке против LAION (см. выше), а также в споре SNE против Meta* (Франция), в рамках которого Ассоциация издателей Франции, Общество писателей и Национальный союз авторов и композиторов в марте 2025 года заявили о начале судебное разбирательства в Парижском суде по факту нарушения авторских прав из-за несанкционированного использования работ истцов в учебных наборах данных ответчика4.
В случаях, когда в качестве нарушения рассматривается генерация контента, воспроизводящего использованные для обучения охраняемые объекты, в качестве ответчиков привлекают поставщиков систем ИИ, а также разработчиков моделей ИИ. Так, в деле Андерсен против Stability AI5 в январе 2023 года группой профессиональных художников заявлен коллективный иск о прямом нарушении авторских прав против ответчика, чьи модели ИИ используются различными поставщиками, включая DreamStudio, Midjourney и DeviantArt.
Если попытаться проанализировать возникающие ситуации с точки зрения российского права, то из анализа статей ГК РФ можно сделать вывод о том, что ИИ не обладает правосубъектностью, то есть сознанием и волей, у него отсутствует имущество для расчетов по обязательствам и он не несет ответственность за свои действия – поэтому ответственность возлагается на разработчиков или пользователей ИИ, причем всё зависит от условий использования и договорных обязательств между сторонами возникших правоотношений. В Кодексе этики в сфере искусственного интеллекта6 содержится позиция о том, что ответственность за работу и последствия применения систем искусственного интеллекта всегда должен нести человек (физическое или юридическое лицо, признаваемое субъектом ответственности в соответствии с действующим законодательством РФ). Этот подход подтверждается судебной практикой – в решении Арбитражного суда г. Москвы от 30 ноября 2023 г. по делу № А40-200471/20237 и в решении Арбитражного суда Республики Калмыкия от 4 августа 2025 г. по делу № А22-2210/2025 нашел отражение аналогичный подход: ответчик использовал чужие фотографии, переработав их с помощью искусственного интеллекта, а затем разместив полученные изображения на маркетплейсе. Суд квалифицировал такие действия как незаконное воспроизведение и переработка охраняемого произведения и взыскал с нарушителя компенсацию. Факт использования искусственного интеллекта не смог освободить ответчика от ответственности8.
Специальное регулирование в части определения сферы ответственности тех или иных субъектов, осуществляющих процессы, обеспечивающие получение, обработку данных, создание программ, их предоставление пользователям и т. д., в российском праве отсутствует. С учетом общих положений ГК РФ об ответственности за нарушение интеллектуальных прав, которые вступают в силу с 4 января 2026 г.1, в случае нарушения на этапе «выхода» есть вероятность привлечения всех указанных лиц в качестве соответчиков к солидарной ответственности.
Раскрытие информации об используемых данных при обучении искусственного интеллекта
Данный вопрос подробно регулируется в ЕС. Закон об искусственном интеллекте (AI Act) (ст. 53) с целью обеспечения прозрачности использования данных требует от поставщиков моделей искусственного интеллекта общего назначения составить и сделать общедоступным достаточно подробное резюме о контенте, используемом для обучения модели искусственного интеллекта общего назначения, в соответствии с шаблоном, представленным Офисом искусственного интеллекта.
Резюме не требует оценки каждой использованной работы с точки зрения соблюдения авторских прав (Декларация, 108). Тем не менее раскрытая информация должна быть достаточно полной, чтобы позволить владельцам авторских прав защищать свои права (Декларация, 107).
Требование к публикации резюме применяется, даже если модель лицензирована на основе открытого исходного кода, поскольку выпуск моделей ИИ общего назначения по бесплатной и открытой лицензии и не обязательно раскрывает существенную информацию о наборе данных, использованном для обучения или тонкой настройки модели, и о том, как при этом обеспечивалось соблюдение закона об авторском праве.
Предусматривается разработка «Кодексов практики», которая должна быть организована Офисом искусственного интеллекта. Основной проблемой является определение достаточного уровня детализации для резюме о содержании, используемом для обучения. Офис также разрабатывает шаблон для подробного резюме данных обучения, которые поставщики модели GPAI обязаны опубликовать. В перспективе предполагается разработать гармонизированные стандарты по рассматриваемым обязательствам поставщиков.
Следует учитывать, что существуют пользователи TDM, которые могут выступать посредниками между владельцами прав и поставщиками ИИ. К таким пользователям относятся, в частности, разработчики наборов данных, которые сами не являются ни разработчиками моделей ИИ, ни поставщиками. Следовательно, они не подпадают под действие обязательств по прозрачности данных и политике авторских прав, установленных статьей 53 Закона об ИИ.
Статья 53 Закона об ИИ также не применяется к разработанным в частном порядке моделям, которые не предоставляются общественности или не вводятся в эксплуатацию под коммерческим названием.
Возложение на поставщиков моделей искусственного интеллекта обязанности раскрывать информацию о том, на каких материалах обучались соответствующие системы, направлено в том числе на защиту правообладателей, которые при наличии такой информации могут контролировать, нарушаются ли их права. Без такого раскрытия предоставить доказательства использования конкретных охраняемых объектов очень затруднительно. Вместе с тем и исполнение такой обязанности тоже связано с целом рядом сложностей как технического, так и правового характера. Например, определяя объем информации, которая должна быть раскрыта, необходимо обеспечить баланс между интересами компаний-поставщиков, в том числе связанными с сохранением коммерческой тайны, и интересами лиц, чьи объекты могут быть использованы для анализа в рамках обучения. Отметим также, что раскрытие ряда данных (например, о реальном правообладателе) может быть невозможно из-за отсутствия достоверной информации. Еще один аспект связан с возможностью использования для обучения систем ИИ объектов, уже сгенерированных с помощью ИИ (охраняемых или не охраняемых в качестве объектов авторских или смежных прав).
В Российской Федерации отсутствуют нормативные требования, обязывающие субъектов, использующих для целей обучения систем ИИ объекты авторских и смежных прав, раскрывать информацию о этом.
Договорные и технические ограничения на веб-скрапинг для сбора данных для обучения
Основным источником данных для обучения моделей искусственного интеллекта является автоматизированное извлечение информации из общедоступных веб-сайтов и веб-страниц (веб-скрапинг). Такой анализ может быть органичен посредством договорных механизмов, причем как в отношении охраняемых интеллектуальными правами объектов, так и неохраняемых.
Владельцы веб-сайтов могут использовать Протоколы исключения роботов (Robot Exclusion Protocol – REP). Протокол используется веб-сайтами для взаимодействия с поисковыми системами и веб-роботами и определяет, какие области веб-сайта нельзя использовать или сканировать. Протокол прямо не
Новоселова Л. А., Рузакова О. А., Гринь Е. С. предназначен для защиты интеллектуальных прав. Вместе с тем в последнее время практика рассматривает такие методы защиты в качестве одного из примеров реализации правообладателями положений об отказе от использования контента для обучения ИИ.
Особенно актуальным является рассмотрение таких методов защиты в контексте применения европейской Директивы DCM, в которой свободное применение методов глубокого анализа данных для коммерческого использования ставится в зависимость от наличия или отсутствия выраженного правообладателем отказа от такого использования. «В тех случаях, когда право отказа было прямо зарезервировано соответствующим образом, поставщикам универсальных моделей ИИ необходимо получить разрешение от правообладателей, если они хотят выполнять интеллектуальный анализ текстов и данных в таких работах»1.
Проблема «резервирования» прав, то есть указания на недопустимость использования защищенного авторскими и смежными правами контента для использования технологий, осуществляющих анализ данных, в том числе и для обучения ИИ, широко обсуждается. Прежде всего, дискуссии возникают относительно того, кто именно может резервировать права на конкретные объекты, размещенные на том или ином сайте. В некоторых юрисдикциях могут быть разные правообладатели в отношении одного и того же результата, что затрудняет решение этого вопроса.
Не менее важны и аспекты, связанные с формой резервирования. Как правило, в отношении объектов, размещенных в Интернете, признается, что резервирование может быть сделано посредством машиночитаемых средств (метаданные и положения об условиях веб-сайта или услуги.) В отношении объектов, недоступных онлайн, приводятся договорные соглашения или одностороннее заявление.
Директива DSCM применяет понятие «явный отказ» для исключения использования материалов в целях обучения ИИ. С учетом практики использования TDM предлагается два варианта толкования: широкое и узкое. При широком толковании «явный отказ» охватывает и ситуации, когда 1) отказ не содержит ссылки на конкретный результат в составе контента; 2) отказ может быть направлен не только на TDM, но и практики, не подпадающие под определение TDM, например веб-скрапинг (который может не включать воспроизведение работ; 3) отказ не обязан указывать на какие-либо правовые положения; 4) отказ не обязательно должен быть направлен на конкретного потенциального пользователя TDM.
Согласно противоположной точке зрения требование «явно» должно толковаться строго и исключать оговорки, которые не являются специфическими для использования, специфическими для контента и могут быть найдены на конкретной странице онлайн-контента (Хаманн, 2024).
Условия обслуживания веб-сайтов могут включать указания, исключающие веб-скрапинг. Ограничения могут быть сформулированы как общие Условия использования (например, «Вам не разрешается использовать этот веб-сайт, кроме как в личных, некоммерческих целях») или как положения, которые конкретно запрещают автоматизированное извлечение, скрапинг, воспроизведение или использование данных без разрешения (например, «Вы не можете использовать автоматизированные системы или программное обеспечение для загрузки контента или извлечения данных с этого веб-сайта»).
Как правило, договорные соглашения оформляются с использованием clickwrap , требующей от пользователей нажать «Я согласен» перед получением доступа к веб-сайту или его частям. Возможны и иные способы подтверждения наличия соглашения.
В деле LAION Гамбургский окружной суд признал, что «резервирование» может быть произведено не только правообладателем, но и лицензиатом в отношении тех объектов, которые он использует на своем сайте. Однако такой лицензиат не может произвести резервирование для иных объектов определенного правообладателя.
В отношении толкования требования о «явном» исключении суд отметил, что условия и положения веб-сайта выполнили требование для действительного отказа, хотя эти условия не ссылались явно на интеллектуальный анализ текста и данных и на какие-либо законодательные положения. Суд признал, что оговорка сформулирована с достаточной ясностью и точностью, чтобы недвусмысленно охватить конкретный контент и конкретное использование. Суд высказал мнение, что оговорка, применяемая ко всем работам, загруженным на веб-сайте, была действительной.
Таким образом, автор оригинала фотографии мог полагаться на оговорку, сделанную сайтом стоковых фотографий. Суд отметил, что не было никаких претензий на противоречивое соглашение между агентством и фотографом.
Согласно консервативному подходу термин «машиночитаемый» применительно к форме оговорки должен трактоваться исключительно как связанный с таким форматом файла, который позволяет его идентифицировать программным средствам. Однако в данном деле суд отказался от такого подхода и указал, что он «рассматривает резервирование использования, выраженное исключительно на “естественном языке”, как “понятное для машины”». Следовательно, Условия и положения вебсайта на естественном языке могут соответствовать критерию «машиночитаемости».
Несколько судебных споров, связанных с претензиями правообладателей, основанными на нарушении договорных условий использования веб-сайтов, инициированы в Канаде.
Так, Канадский институт юридической информации (CanLII) в ноябре 2024 года обратился с иском в Верховный суд Британской Колумбии, обвинив ответчика в нарушении своих прав на базу данных. Истец является некоммерческой организацией, финансируемой Федерацией юридических обществ Канады, и управляет общедоступной базой данных канадских юридических документов, которая содержит около 3,5 млн документов и широко используется канадскими исследователями и юристами. Ответчик является компанией в области разработки ИИ, основанной в Канаде, зарегистрированной в Ирландии. Компания-ответчик разработала ИИ-чатбота для помощи в юридических исследованиях. Истец полагает, что ответчик незаконно использовал базу данных истца для обучения своего чат-бота, нарушил условия использования базы данных.
В уведомлении о гражданском иске от 4 ноября 2024 г. отмечается: истец «тратит значительное время, ресурсы и экспертные знания на рассмотрение, анализ, отбор, агрегацию, каталогизацию, аннотирование, индексацию и иное улучшение Данных перед публикацией своего исходного рабочего продукта на вебсайте истца».1 Нарушение договора основано на условиях использования, указанных на веб-сайте истца, которые включают запрет на «массовую или систематическую загрузку CanLII Works, в том числе с помощью программных средств или путем найма человеческих ресурсов для ручной загрузки CanLII Works». Истец утверждает, что несанкционированное использование ответчиком и последующие публикация и распространение скопированных материалов (через службы искусственного интеллекта ответчика) являются нарушением авторских прав.
Другой пример: в ноябре 2024 года в Высший суд Онтарио (Канада) обратилась коалиция ведущих канадских медиакомпаний и издателей новостей, подав иск против компании OpenAI2. По мнению истцов, ответчик нарушил их авторские права, когда без разрешения скопировал данные с их веб-сайтов, проигнорировав ограничения авторских прав, указанные в положениях и условиях их веб-сайтов, обошел платные доступы и совершил обход технологических мер защиты в своей деятельности по скра-пингу. Ответчик заявляет, что ее модели обучаются на общедоступных данных.
В исследовании ВОИС отмечается, что резервирование, реализованное на одном интернет-ре-сурсе, не означает наличия резервирования этих объектов на иных ресурсах, принадлежащих данному лицензиату. Правообладатель, который хочет повсеместно отказаться от TDM, может согласовать выражение этой оговорки с различными лицензиатами, через которых его контент становится доступным для общественности. Оговорка, привязанная к месторасположению, например, на определенном веб-сайте, не гарантирует резервирование прав на лицензионные копии того же контента, размещенные на других веб-сайтах. Лицензиат или другой представитель может делать резервирование от имени правообладателя, если у него есть явные полномочия сделать отказ и если ему передано управление правами на воспроизведение. Пока нет окончательной ясности относительно того, кто может осуществлять резервирование, если имеется несколько лицензиатов с различным объемом прав.
Еще одним спорным моментом является определение границ допустимых действий правообладателей, направленных на исключение возможности использования данных, в том числе охраняемых в качестве объектов интеллектуальных прав, если закон допускает их свободное использование.
Российское право допускает использование технических средств защиты авторских прав (ст. 1299 ГК РФ), под которыми понимаются любые технологии, технические устройства или их компоненты, контролирующие доступ к произведению, предотвращающие или ограничивающие осуществление действий, которые не разрешены автором или иным правообладателем в отношении произведения. Аналогичным образом определяются технические средства защиты смежных прав (ст. 1309 ГК РФ). Осуществление без разрешения автора или иного правообладателя действий, направленных на то, чтобы устранить ограничения использования произведения, установленные путем применения технических средств защиты авторских прав, не допускается и влечет применение мер ответственности к нарушителю в форме возмещения убытков или взыскания компенсации.
Договорные условия использования . В коммерческой практике последних лет уже достаточно широко распространено заключение лицензионных соглашений между субъектами, осуществляющими обучение систем ИИ и правообладателями. Актуальность договорных механизмов возрастает в условиях различных подходов правовых систем к особенностям регулирования этих отношений, неопределенности судебной практики в вопросах использования охраняемых объектов для обучения ИИ, очень часто – трансграничного характера отношений.
Для оформления отношений, связанных с передачей прав для рассматриваемых целей, могут использоваться модели различных лицензионных договоров. Так, примером лицензии на использование данных с целью обучения моделей искусственного интеллекта являются условия пользовательского соглашения облачного сервиса видеоконференций Zoom, предусматривающие предоставление лицензии в адрес Zoom на пользовательский контент (customercontent) с целью обучения моделей искусственного интеллекта и дальнейшего развития продуктов компании с правом сублицензирования. Подобные условия в целом становятся всё более распространенными по мере того, как конкурентоспособность SaaS-сервиса начинает зависеть от используемых в нем моделей ИИ [17].
Вместе с тем практика лицензирования сталкивается с отсутствием сформировавшихся правил в этой сфере. В частности, нет четкого понимания того, как должна строиться система лицензирования в ситуации, когда в цепочке сбора исходного материала для обучения моделей искусственного интеллекта участвуют несколько субъектов, в том числе: лица, агрегирующие массивы первоначальных исходных данных; лица, осуществляющие первичную подготовку таких материалов для субъектов, непосредственно осуществляющих процесс обучения ИИ; разработчики систем ИИ, поставщики таких систем и т. д.
Не сформирован порядок ценообразования в случаях, когда права предоставляются возмездно. На практике используются различные механизмы формирования цены, в том числе посредством распределения доходов от использования системы ИИ между правообладателями исходных объектов, разработчиками и пользователями, но даже в этом случае ориентировочные коммерческие условия установления цены и распределения доходов не сложились.
Особые сложности возникают в процессе сбора данных в связи с тем, что ряд правообладателей используют технические системы защиты либо вносят информацию о запрете использования объектов авторских и смежных прав для обучения, но стандарты информирования не разработаны, что затрудняет выявление проблемных источников в процессе сбора материалов для обучения ИИ.
Для устранения нарушений исключительных прав на использование охраняемых объектов в целях обучения искусственного интеллекта часто рекомендуют использовать объекты, которые предоставляются в рамках открытых лицензий в соответствии с их условиями. «Opensource библиотеки и фреймворки, такие как TensorFlow, PyTorch и Scikitlearn, активно используются для разработки и внедрения алгоритмов машинного обучения и искусственного интеллекта в различных областях, от автоматизации биз-нес-процессов до разработки персонализированных рекомендательных систем. Многие блокчейн-плат-формы, например, Hyperledger и криптовалюты, включая Bitcoin и Ethereum, основаны на Opensource технологиях. Это способствует открытости, безопасности и инновациям в финансовой индустрии. Opensource облачные платформы, такие как OpenStack или Kubernetes, лежат в основе многих облачных сервисов» [17].
Вместе с тем сам факт распространения объектов на условиях открытых лицензий не является гарантией нарушения, поскольку и в этом случае необходимо исходить из условий соответствующих соглашений. В частности, открытая лицензия, допускающая воспроизведение для целей анализа текста или изображения, может не предоставлять прав на воспроизведение самого использованного для обучения объекта системой ИИ на стадии выдачи результата по запросу.
Вместе с тем индивидуальное лицензирование затруднено и экономически невыгодно, когда речь идет о массивах самого разнообразного контента, принадлежащего различным самостоятельным небольшим правообладателям. Нельзя не учитывать, что в ситуации неопределенности подходов национальных регуляторов и проблем трансграничных сделок правовые риски очень велики. В связи с этим появляются и другие инициативы, направленные на организацию взаимодействия между крупными правообладателями и разработчиками ИИ, облегчающего поиск и законное использование объектов интеллектуальных прав. Например, Cloudflare анонсировал создание летом 2025 года системы, в рамках которой крупные правообладатели размещают данные на определенных ресурсах для безвозмездного использования, а на других – с условием выплаты вознаграждения. Система гарантирует выплаты при каждом использовании соответствующих платных ресурсов, начисления производятся авто-матически2.
Важное значение в части договорных отношений по обучению искусственного интеллекта могут иметь лицензионные договоры о предоставлении права на использование баз данных. Определение порядка предоставления доступа к наборам данных и обеспечение доступности данных для разработчиков технологии искусственного интеллекта – такие задачи были обозначены еще в 2019 году в рамках Национальной стратегии развития искусственного интеллекта на период до 2030 года. Однако не вся информация, которая может быть использована искусственным интеллектом, подпадает под определение такого объекта интеллектуальных прав, как база данных. Достаточно часто в используемых наборах данных отсутствует такой признак, как систематизация материала. В отношении «неструктурированных (несистематизированных) совокупностей данных используется термин DataLake (от англ. «озеро данных»). В упрощенном понимании «озеро данных» – это объективная форма совокупности большого количества данных, в отношении которых не проводились систематизация и отбор, но в будущем планируются их анализ, обработка и систематизация. Учитывая изложенное, следует заключить, что «“озеро данных” не может быть квалифицировано в качестве базы данных, так как не соответствует критерию систематизации» [12]. Вместе с тем такие базы данных, которые не охраняются как объекты авторских и иных интеллектуальных прав, могут охраняться с применением договорных ограничений на использование веб-сайтов, а также с помощью технических средств защиты.
Выводы
Вопросы, связанные с защитой интеллектуальных прав в процессе сбора данных, наполнения ими искусственного интеллекта, а также правовым режимом создаваемых объектов, в том числе с точки зрения использования права на переработку авторов первоначальных произведений, сохраняют свою актуальность. Технологии искусственного интеллекта обучаются на огромном количестве уже существующих работ, созданных человеком, и используют выводы из этого обучения для создания нового контента. Полученные результаты могут быть текстовыми, визуальным, звуковыми и иными и определяются нейросетями на основе дизайна и материала, на котором они были обучены.
Процесс обучения моделей ИИ состоит из нескольких отдельных этапов и может различаться в зависимости от модели, при этом каждый этап и каждый процесс имеют свои последствия для авторских прав. Условно можно выделить: этапы ввода данных – когда охраняемые объекты авторских и смежных прав в аналоговой форме «оцифровываются», а уже существующие в цифровой форме копируются на другой носитель для целей их дальнейшей обработки и анализа; этап обработки, на котором указанные объекты подвергаются анализу (разбиваются на фрагменты, размечаются и т. д.); этап использования собственно в механизме обучения (математический анализ внесенных данных); этап выдачи результата (генерации), на котором может быть воспроизведен один из использованных на первом этапе объектов или сходный с ним «до степени смешения».
На каждом этапе (кроме этапа математического анализа) потенциально существует риск нарушения авторских и смежных прав: права на воспроизведение, права на неприкосновенность объекта, права на имя автора и т. д.
Ведущиеся в разных странах судебные процессы (многие из которых не закончены) демонстрируют, что исковые требования чаще всего касаются нарушения авторских прав (чаще на литературные произведения и изображения, реже – на музыкальные произведения и видео), а также прав на базы данных. В качестве нарушений рассматриваются как процедуры, связанные с незаконным использованием охраняемых объектов интеллектуальных прав для обучения моделей (этап входа), так и нарушения, касающиеся воспроизведения загруженных объектов, доведения их до всеобщего сведения (распространение, показ произведения) на стадии функционирования систем генеративного ИИ (этап вывода результата). Для баз данных, охраняемых смежным правом , может быть затронуто право извлечения материалов и их использования. Какие именно правомочия и каким образом затрагиваются – зависит от особенностей применяемых технологий.
В зависимости от применимого права суды подробно анализируют наличие критериев допустимого использования охраняемых объектов, исходя из его цели и наличия ограничений, установленных для данного вида использования. В странах общего права актуальная судебная практика подтверждает, что суды применяют к спорным ситуациям критерии добросовестного использования, особо обращая внимание на критерий, связанный с недобросовестной конкуренцией. Достаточно часто в делах обсуждаются вопросы, связанные с нарушениями ответчиками условий веб-сайтов, запрещающих практику веб-скрапинга.
Сложность в таких спорах вызывает доказывание факта использования охраняемых результатов для обучения системы ИИ. В качестве доказательств в ряде случаев применяются ссылки на публичную документацию, в которой разработчики ссылаются на используемые ими наборы данных для обучения (например, в техническом документе), и на включение своих работ в эти наборы данных, если такая информация является общедоступной. Иногда правообладатели основывают выводы об используемых для обучения данных, демонстрируя, что определенные подсказки приводят к результатам, которые могут быть получены только в том случае, если конкретные работы были включены в обучающие данные.
В целом ряде случаев правообладатели не могут доказать реальный ущерб, понесенный в результате несанкционированного использования принадлежащих им прав. В особо невыгодном положении оказываются мелкие правообладатели, которые полагают, что их работы используются для обучения ИИ без их разрешения, но не заявляют претензий в отношении незаконности результатов, которые конкурируют с их оригинальными работами. Особенно критично данное обстоятельство для применения концепции «добросовестного использования» в США, поскольку наличие такой конкуренции является одним из критериев этого использования.
Дальнейшее регулирование может развиваться различным образом, в частности, возможно признание использования охраняемых авторским и смежными правами объектов для обучения систем ИИ одним из случаев свободного использования, с выплатой или без выплаты вознаграждения правообладателю. Одним из предложений является введение исключения из общего правила, требующего положительного согласия правообладателя на использование произведения, и установления презумпции подразумеваемого согласия для случаев использования для целей обучения ИИ . Несмотря на привлекательность такого решения, его практическая реализация с учетом огромного массива данных, используемых для обучения, может создать значительные практические трудности.
Поскольку количество объектов авторских и смежных прав, которые могут быть использованы для обучения ИИ, ограничено, широко обсуждается вопрос о допустимости использования для этих целей материалов, которые были созданы системами ИИ, и правовых последствиях такого использования с учетом различий в подходах к квалификации таких объектов в качестве объектов интеллектуальных прав.
На фоне разнообразия подходов правовых систем к установлению порядка и условий допуска к использованию объектов авторских и смежных прав для целей обучения ИИ появляется всё больше различных вариантов договорного урегулирования отношений разработчиков ИИ и правообладателей.
Российская правовая система пока не предложила законодательных решений задачи согласования целей развития новых технологий ИИ и защиты интеллектуальных прав. Построение возможных моделей затруднено отсутствием судебных прецедентов, объяснимым отсутствием какой-либо позиции регуляторов. В российском праве полностью отсутствует понятийный аппарат, отражающий появление новых технологий и связанных ними рынков. В частности, в отличие от законодательства ЕС, не сформулирована дефиниция технологий исследования данных, не определены основные участники отношений по созданию, обучению и развертыванию ИИ. Это еще больше осложняет как положение субъектов, включенных в цепочку подготовки и обработки данных для обучения систем ИИ, так и положение правоприменителей.
Важными шагами по реализации модели правового регулирования рассматриваемых отношений являются:
– установление в законе статуса и сферы ответственности лиц, участвующих в процессе создания, обучения, развертывания систем ИИ;
– выделение в качестве самостоятельных способов использования объектов авторских и смежных прав – анализа и обработки данных, включающих объекты авторских и ряда смежных прав, для целей обучения ИИ, при одновременном устранении пересечений с другими способами использования, описанными в ГК РФ;
– установление презумпции недопустимости использования объектов авторских и смежных прав для целей обучения ИИ без согласия правообладателя и без выплаты вознаграждения, кроме специально установленных случаев. Возможность свободного использования должна быть обеспечена для научных, исследовательских организаций, образовательных учреждений – без права распоряжения полученными по итогам обработки результатами, а также для личных целей.
Дополнительного обсуждения требуют методики расчета вознаграждения, а также меры по защите личных неимущественных прав авторов. Одним из вариантов решения является создание системы коллективного управления для обеспечения защиты прав правообладателей при использовании охраняемых объектов для целей анализа и обработки данных, используемых для обучения систем ИИ. Вместе с тем выбор этого варианта не исключает необходимости устранения многих ранее отмеченных пробелов в регулировании.