Sony и Warner судятся с основателями Anthropic лично: чем вы докажете, откуда взяли данные

28 августа 2026 года Sony Music Publishing и Warner Chappell подали иск в суд Северного округа Калифорнии. Ответчики - не только Anthropic, но и Дарио Амодеи с Бенджамином Манном как физлица. Разбираю по тексту жалобы, что требуют и почему это вопрос к вашему датасету.

Иски к ИИ-компаниям про авторские права идут пачками, и разбирать каждый давно нет смысла. В этом меня зацепила одна строчка: рядом с названием компании в графе «ответчики» стоят два живых человека.

Полез читать саму жалобу - 48 страниц, лежат в открытом доступе. Ниже разбор того, что там написано, и почему это вопрос не к юристам Anthropic, а к тому, как вы собираете данные для своего продукта.

Что случилось

28 августа 2026 года Sony Music Publishing и Warner Chappell Music подали иск в федеральный окружной суд Северного округа Калифорнии. Дело 5:26-cv-09217, судья Эдвард Чен, требование - суд присяжных.

Ответчиков трое: сама Anthropic PBC, её CEO и сооснователь Дарио Амодеи и сооснователь Бенджамин Манн - последние двое как физические лица, а не как должности. Издатели называют это «одной из крупнейших и самых наглых непрекращающихся краж интеллектуальной собственности в истории» (Music Business Worldwide).

Оговорка обязательная, без неё дальше читать нельзя: иск только подан. Ничего не доказано, решения нет, а личная ответственность основателей - это пока требование истцов, и суды такие требования отклоняют чаще, чем удовлетворяют. Anthropic обвинения отвергает: «Мы не согласны с претензиями издателей и намерены жёстко защищаться в суде» (Engadget).

Что именно требуют

В жалобе четыре пункта, и они по-разному адресованы:

  • прямое нарушение через торренты - против всех троих, включая Амодеи и Манна;

  • содействующее нарушение (contributory infringement) через торренты - только против Амодеи и Манна, то есть за то, что они направляли и одобряли действия других;

  • прямое нарушение при обучении и в ответах модели - только против компании;

  • удаление или изменение сведений об авторских правах - тоже только против компании.

Денежные требования - две ставки. До $150 000 за одно произведение при умышленном нарушении: это не оценка ущерба, а потолок так называемых установленных законом убытков (17 U.S.C. § 504(c)), которые присяжные могут присудить, вообще не считая реальные потери. И до $25 000 за каждый случай снятия сведений о правообладателе - другая норма, § 1203(c)(3)(B).

Отдельно истцы просят уничтожить все контрафактные копии и - самое интересное для практики - обязать ответчиков предоставить отчёт об обучающих данных, методах обучения и известных возможностях моделей: назвать, на каких именно текстах учили Claude.

Жалоба описывает путь от пиратской библиотеки до обучающего набора данных
Музыкальные произведения утекают в обучающий датасет
Сколько там композиций на самом деле

В пересказах гуляет «более 20 000 песен». В тексте жалобы такого числа нет. Есть формулировка «десятки тысяч» композиций из Приложения B - это работы, скопированные при обучении и воспроизведённые в ответах модели. И «сотни или больше» произведений из Приложения A - те, что попали в книги, скачанные с торрентов.

Причём в самой жалобе прямо написано: оба приложения - примерные и неисчерпывающие списки. Точное число появится только на стадии раскрытия доказательств. Так что любая сумма, которую вы видите в заголовках, посчитана из округлённого «десятки тысяч», а не из реестра.

Почему пошли на людей, а не только на компанию

Логика истцов строится не на эмоциях, а на внутреннем процессе Anthropic. По её собственной политике получение или использование нового набора данных требовало явного одобрения Амодеи - так написано в жалобе.

Дальше конкретика с датами. В июне 2021 года Манн через BitTorrent скачал не менее пяти миллионов пиратских книг с Library Genesis. В июле 2022 года сотрудники компании скачали ещё как минимум два миллиона с Pirate Library Mirror. Обе цифры взяты не из воздуха - их установил суд по делу Bartz v. Anthropic, где судья назвал происходившее «прямым пиратством, только в промышленном масштабе».

И ключевое: Манн в возражениях по другому делу (Concord Music Group против Anthropic, 5:26-cv-00880-EKL) признал, что обсуждал получение данных LibGen с Амодеи и что «доктор Амодеи одобрил». Отсюда вывод истцов: без указания и согласия этих двоих торрентов бы не было.

Вот это и есть неприятная часть сюжета. Согласование новых датасетов на уровне первого лица - взрослая, правильная практика, её советуют все. Ровно она и превратилась в аккуратно задокументированный след к конкретной фамилии.

⚠️
Пункт, который все пропускают

Четвёртый пункт иска - не про обучение вообще. При подготовке текстов Anthropic вычищала из них повторяющийся «мусор». Издатели отвечают: то, что вы считаете мусором, - это copyright management information, сведения о правообладателе: имя автора, знак копирайта, номер и условия лицензии. Их снятие по американскому закону (17 U.S.C. § 1202) образует отдельное нарушение, которое живёт независимо от спора «было обучение добросовестным использованием или нет».

  • Скрипт, который перед токенизацией срезает колонтитулы, строки копирайта и служебные метаданные, - типовой шаг подготовки любого корпуса. По этой норме каждый такой случай тянет до $25 000.

  • Даже если суд признает само обучение законным, претензия по снятым меткам останется: она про то, что вы стёрли имя автора, а не про то, что вы на нём учились.

Считаем, откуда берутся миллиарды

Единственная реальная точка отсчёта - дело Bartz v. Anthropic: то же поведение, те же торренты, только про книги. Мировое соглашение на $1,5 млрд суд окончательно утвердил 20 июля 2026 года (JURIST). В список работ вошло 482 460 позиций.

Считаем ставку: 1 500 000 000 / 482 460 = $3 109 за произведение. По условиям соглашения её округляли до «примерно $3 000 за книгу».

Теперь подставим осторожное прочтение «десятков тысяч» - пусть будет 30 000 композиций. Это моё допущение, в жалобе такой цифры нет:

  • по потолку закона: 30 000 × $150 000 = $4,5 млрд;

  • по фактической ставке Bartz: 30 000 × $3 109 ≈ $93 млн;

  • плюс отдельно за снятые метки: 30 000 × $25 000 = $750 млн, но эта часть предъявлена только компании.

Разрыв между первой и второй строкой - в 48 раз. Заголовки считают по первой, реальные дела заканчиваются ближе ко второй. Держите обе цифры рядом, когда читаете новость про «многомиллиардный иск».

Отдельный пункт иска - про метки правообладателя, снятые при подготовке данных
Метку правообладателя срезают при чистке датасета
Что проверить в своём продукте

Сразу про юрисдикцию: дело американское, нормы американские, российское право понятия fair use не знает вообще. Но если вы продаёте в США, выкладываете модель или отдаёте датасет наружу - спрашивать будут по месту, а не по прописке. По шагам:

  • Заведите журнал происхождения данных. Для каждого набора: откуда взят, когда, по какой лицензии, кто согласовал, чем подтверждается право - чек, лицензия, договор. Выглядит бюрократией ровно до требования «предоставьте отчёт об обучающих данных», которое стоит пунктом в этой жалобе.

  • Разделяйте «обучил» и «храню». Судья Алсуп в решении от 23 июня 2025 года провёл именно эту границу: обучение на легально купленных книгах - добросовестное использование, а вот постоянная библиотека из пиратских копий - нет (разбор Goodwin). Претензия может прилететь не к модели, а к папке на диске.

  • Проверяйте лицензию датасета, а не его доступность. «Лежит открыто» и «можно брать» - разные вещи. Books3 на 200 000 книг годами кочевал по обучающим корпусам, пока в 2023 году его не снесли по DMCA-запросу датской Rights Alliance (TorrentFreak). Копии по сети остались, законность - нет.

  • Не срезайте метаданные автора при чистке корпуса. Знак копирайта и имя правообладателя - не мусор, а отдельная охраняемая информация; выше про § 1202.

  • Считайте файнтюн на скачанном датасете статьёй расходов, а не бесплатным шагом. У этого риска теперь есть числовой диапазон - от трёх тысяч долларов за произведение по факту до ста пятидесяти по закону.

Частые вопросы
  • Амодеи и Манна признали виновными? Нет. Иск подан 28 августа 2026 года, ответчики обвинения отвергают, решения по делу нет. Личная ответственность основателей - требование истцов, не факт.

  • Обучать модели на чужих текстах теперь нельзя? Американская практика разделила вопрос: обучение на легально полученных материалах суд по делу Bartz признал добросовестным использованием. Претензии остались к способу получения и к хранению копий.

  • Я не обучаю модели, а просто дёргаю API - меня это касается? Напрямую нет. Косвенно - да, если у вас есть свой файнтюн или подрядчик, который собирает для вас данные.

  • Claude теперь опасно использовать? Иск про обучение, а не про пользователей: ни одно требование не направлено на клиентов сервиса.

  • Где посмотреть первоисточник? Текст жалобы, 48 страниц и карточка дела лежат открыто, читаются без регистрации.

Самое полезное в этой истории - не сумма требований и даже не фамилии в шапке иска. Вопрос сместился с «можно ли обучать на чужом» на «сможете ли вы через три года объяснить, откуда у вас эти файлы».

А вы сможете назвать источник и лицензию для каждого набора данных, на котором учили или файнтюнили? Расскажите, чем ведёте учёт - или чем собираетесь.

Разберём происхождение данных в вашем проекте - напишите мне

Подписаться на @kursorai