USA Today Co. вместе с рядом принадлежащих ей местных газет подала иск против OpenAI в федеральный суд Нью-Йорка. Издатель требует более 250 млн долларов, утверждая, что компания без разрешения использовала сотни тысяч статей для обучения и работы своих моделей. Значение дела в том, что оно расширяет серию претензий медиа к разработчикам генеративного AI: предметом спора становятся одновременно состав обучающих корпусов, воспроизведение материалов в ответах и удаление сведений об авторских правах.

По данным Forbes, иск подали USA Today Co. и 13 связанных с ней структур, а претензии касаются контента 19 изданий. Истцы обвиняют OpenAI в умышленном нарушении авторских прав и считают, что компания копировала их публикации для обучения моделей, а затем воспроизводила или переупаковывала журналистскую работу для пользователей ChatGPT. Это позиция истцов, которая пока не получила судебной оценки.

Какие данные указаны в иске.

Жалоба связывает спорный контент с несколькими известными наборами данных. В частности, издатель указывает на более чем 160 тыс. записей с его доменов в WebText — наборе, использовавшемся для GPT-2. Также упоминается срез Common Crawl C4 за 2019 год: в нём, по версии истцов, содержалось свыше 122 млн токенов из материалов группы, включая 23 млн токенов с usatoday.com. Эти цифры описаны в иске и не являются независимым подтверждением того, какие именно данные использовались в каждой последующей версии модели.

Как пишет Crypto Briefing, истцы отдельно оценили число материалов с usatoday.com примерно в 83 266 публикаций. Они также добиваются судебного запрета на дальнейшее предполагаемое копирование. Ещё одно требование связано с copyright management information — служебной информацией об авторе, заголовке и правообладателе. По мнению издателя, удаление таких сведений может составлять отдельное нарушение помимо самого копирования текста.

Почему спор касается не только обучения.

В жалобе приведены примеры ответов GPT-5.6 на запросы, предполагающие пересказ с сохранением близкой структуры или перефразирование. Истцы утверждают, что модель выдавала подробные резюме статей из Indianapolis Star и Detroit Free Press. Для медиа этот элемент принципиален: одних доказательств присутствия текстов в веб-корпусах недостаточно, чтобы описать весь предполагаемый ущерб. Поэтому иск соединяет вопрос о сборе данных с вопросом о том, способны ли продукты OpenAI замещать обращение к оригинальной публикации.

Издатель также ссылается на то, что OpenAI заключала платные соглашения с другими новостными организациями. В логике истцов, это показывает, что использование журналистского контента требует лицензирования. Однако наличие таких договоров само по себе не отвечает на главный правовой вопрос этого дела: должен ли разработчик получать разрешение на каждый материал, попавший в обучение, и в каких случаях результат работы модели становится нарушающим воспроизведением.

Новый иск в серии претензий издателей.

Дело USA Today появилось на фоне уже идущих процессов. Как отмечает The Verge, с исками к OpenAI ранее обращались The New York Times, The Intercept, Ziff Davis, CBC/Radio-Canada, Encyclopaedia Britannica, Merriam-Webster, The Seattle Times и коалиция почти 400 местных газет. В кратком сообщении NewsBytes дело USA Today также рассматривается как часть этого более широкого конфликта между новостной индустрией и поставщиками моделей.

По оценке автора юридического обзора ChatGPTIsEatingtheWorld, в иске заявлены три знакомые по подобным делам основания: прямое нарушение авторских прав, косвенное нарушение и удаление информации об управлении авторскими правами по DMCA. Там же указано, что аналогичные требования остаются в споре The New York Times с OpenAI. Это не делает дела тождественными: у USA Today свой набор публикаций, собственные примеры ответов модели и отдельный расчёт предполагаемого ущерба.

Что это меняет для рынка AI.

Иск показывает, что дискуссия о данных для LLM выходит за пределы абстрактного вопроса о доступности текста в интернете. Издатели пытаются связать три уровня: попадание произведения в исходные веб-наборы, его предполагаемое сохранение или кодирование в модели и выдачу ответа, который может заменить чтение первоисточника. Для OpenAI и других разработчиков это означает, что в судебных спорах будут рассматриваться не только принципы обучения, но и конкретные сценарии работы поисковых и чат-интерфейсов.

Для команд, создающих продукты на базе LLM, практический вывод состоит в необходимости различать происхождение корпуса, права на контент и поведение готового сервиса. Претензия USA Today не доказывает нарушение сама по себе, а размер запрошенной компенсации не равен присуждённой сумме. На момент публикации, по данным Crypto Briefing, OpenAI публично не ответила на обвинения именно по этому делу. Дальнейшее значение иска будет зависеть от того, как суд оценит доказательства использования материалов и приведённые примеры генерации.