28 августа 2026 года Sony Music Publishing и Warner Chappell подали иск в суд Северного округа Калифорнии. Ответчики - не только Anthropic, но и Дарио Амодеи с Бенджамином Манном как физлица. Разбираю по тексту жалобы, что требуют и почему это вопрос к вашему датасету.
Иски к ИИ-компаниям про авторские права идут пачками, и разбирать каждый давно нет смысла. В этом меня зацепила одна строчка: рядом с названием компании в графе «ответчики» стоят два живых человека.
Полез читать саму жалобу - 48 страниц, лежат в открытом доступе. Ниже разбор того, что там написано, и почему это вопрос не к юристам Anthropic, а к тому, как вы собираете данные для своего продукта.
28 августа 2026 года Sony Music Publishing и Warner Chappell Music подали иск в федеральный окружной суд Северного округа Калифорнии. Дело 5:26-cv-09217, судья Эдвард Чен, требование - суд присяжных.
Ответчиков трое: сама Anthropic PBC, её CEO и сооснователь Дарио Амодеи и сооснователь Бенджамин Манн - последние двое как физические лица, а не как должности. Издатели называют это «одной из крупнейших и самых наглых непрекращающихся краж интеллектуальной собственности в истории» (Music Business Worldwide).
Оговорка обязательная, без неё дальше читать нельзя: иск только подан. Ничего не доказано, решения нет, а личная ответственность основателей - это пока требование истцов, и суды такие требования отклоняют чаще, чем удовлетворяют. Anthropic обвинения отвергает: «Мы не согласны с претензиями издателей и намерены жёстко защищаться в суде» (Engadget).
В жалобе четыре пункта, и они по-разному адресованы:
прямое нарушение через торренты - против всех троих, включая Амодеи и Манна;
содействующее нарушение (contributory infringement) через торренты - только против Амодеи и Манна, то есть за то, что они направляли и одобряли действия других;
прямое нарушение при обучении и в ответах модели - только против компании;
удаление или изменение сведений об авторских правах - тоже только против компании.
Денежные требования - две ставки. До $150 000 за одно произведение при умышленном нарушении: это не оценка ущерба, а потолок так называемых установленных законом убытков (17 U.S.C. § 504(c)), которые присяжные могут присудить, вообще не считая реальные потери. И до $25 000 за каждый случай снятия сведений о правообладателе - другая норма, § 1203(c)(3)(B).
Отдельно истцы просят уничтожить все контрафактные копии и - самое интересное для практики - обязать ответчиков предоставить отчёт об обучающих данных, методах обучения и известных возможностях моделей: назвать, на каких именно текстах учили Claude.

В пересказах гуляет «более 20 000 песен». В тексте жалобы такого числа нет. Есть формулировка «десятки тысяч» композиций из Приложения B - это работы, скопированные при обучении и воспроизведённые в ответах модели. И «сотни или больше» произведений из Приложения A - те, что попали в книги, скачанные с торрентов.
Причём в самой жалобе прямо написано: оба приложения - примерные и неисчерпывающие списки. Точное число появится только на стадии раскрытия доказательств. Так что любая сумма, которую вы видите в заголовках, посчитана из округлённого «десятки тысяч», а не из реестра.
Логика истцов строится не на эмоциях, а на внутреннем процессе Anthropic. По её собственной политике получение или использование нового набора данных требовало явного одобрения Амодеи - так написано в жалобе.
Дальше конкретика с датами. В июне 2021 года Манн через BitTorrent скачал не менее пяти миллионов пиратских книг с Library Genesis. В июле 2022 года сотрудники компании скачали ещё как минимум два миллиона с Pirate Library Mirror. Обе цифры взяты не из воздуха - их установил суд по делу Bartz v. Anthropic, где судья назвал происходившее «прямым пиратством, только в промышленном масштабе».
И ключевое: Манн в возражениях по другому делу (Concord Music Group против Anthropic, 5:26-cv-00880-EKL) признал, что обсуждал получение данных LibGen с Амодеи и что «доктор Амодеи одобрил». Отсюда вывод истцов: без указания и согласия этих двоих торрентов бы не было.
Вот это и есть неприятная часть сюжета. Согласование новых датасетов на уровне первого лица - взрослая, правильная практика, её советуют все. Ровно она и превратилась в аккуратно задокументированный след к конкретной фамилии.
Четвёртый пункт иска - не про обучение вообще. При подготовке текстов Anthropic вычищала из них повторяющийся «мусор». Издатели отвечают: то, что вы считаете мусором, - это copyright management information, сведения о правообладателе: имя автора, знак копирайта, номер и условия лицензии. Их снятие по американскому закону (17 U.S.C. § 1202) образует отдельное нарушение, которое живёт независимо от спора «было обучение добросовестным использованием или нет».
Скрипт, который перед токенизацией срезает колонтитулы, строки копирайта и служебные метаданные, - типовой шаг подготовки любого корпуса. По этой норме каждый такой случай тянет до $25 000.
Даже если суд признает само обучение законным, претензия по снятым меткам останется: она про то, что вы стёрли имя автора, а не про то, что вы на нём учились.
Единственная реальная точка отсчёта - дело Bartz v. Anthropic: то же поведение, те же торренты, только про книги. Мировое соглашение на $1,5 млрд суд окончательно утвердил 20 июля 2026 года (JURIST). В список работ вошло 482 460 позиций.
Считаем ставку: 1 500 000 000 / 482 460 = $3 109 за произведение. По условиям соглашения её округляли до «примерно $3 000 за книгу».
Теперь подставим осторожное прочтение «десятков тысяч» - пусть будет 30 000 композиций. Это моё допущение, в жалобе такой цифры нет:
по потолку закона: 30 000 × $150 000 = $4,5 млрд;
по фактической ставке Bartz: 30 000 × $3 109 ≈ $93 млн;
плюс отдельно за снятые метки: 30 000 × $25 000 = $750 млн, но эта часть предъявлена только компании.
Разрыв между первой и второй строкой - в 48 раз. Заголовки считают по первой, реальные дела заканчиваются ближе ко второй. Держите обе цифры рядом, когда читаете новость про «многомиллиардный иск».

Сразу про юрисдикцию: дело американское, нормы американские, российское право понятия fair use не знает вообще. Но если вы продаёте в США, выкладываете модель или отдаёте датасет наружу - спрашивать будут по месту, а не по прописке. По шагам:
Заведите журнал происхождения данных. Для каждого набора: откуда взят, когда, по какой лицензии, кто согласовал, чем подтверждается право - чек, лицензия, договор. Выглядит бюрократией ровно до требования «предоставьте отчёт об обучающих данных», которое стоит пунктом в этой жалобе.
Разделяйте «обучил» и «храню». Судья Алсуп в решении от 23 июня 2025 года провёл именно эту границу: обучение на легально купленных книгах - добросовестное использование, а вот постоянная библиотека из пиратских копий - нет (разбор Goodwin). Претензия может прилететь не к модели, а к папке на диске.
Проверяйте лицензию датасета, а не его доступность. «Лежит открыто» и «можно брать» - разные вещи. Books3 на 200 000 книг годами кочевал по обучающим корпусам, пока в 2023 году его не снесли по DMCA-запросу датской Rights Alliance (TorrentFreak). Копии по сети остались, законность - нет.
Не срезайте метаданные автора при чистке корпуса. Знак копирайта и имя правообладателя - не мусор, а отдельная охраняемая информация; выше про § 1202.
Считайте файнтюн на скачанном датасете статьёй расходов, а не бесплатным шагом. У этого риска теперь есть числовой диапазон - от трёх тысяч долларов за произведение по факту до ста пятидесяти по закону.
Амодеи и Манна признали виновными? Нет. Иск подан 28 августа 2026 года, ответчики обвинения отвергают, решения по делу нет. Личная ответственность основателей - требование истцов, не факт.
Обучать модели на чужих текстах теперь нельзя? Американская практика разделила вопрос: обучение на легально полученных материалах суд по делу Bartz признал добросовестным использованием. Претензии остались к способу получения и к хранению копий.
Я не обучаю модели, а просто дёргаю API - меня это касается? Напрямую нет. Косвенно - да, если у вас есть свой файнтюн или подрядчик, который собирает для вас данные.
Claude теперь опасно использовать? Иск про обучение, а не про пользователей: ни одно требование не направлено на клиентов сервиса.
Где посмотреть первоисточник? Текст жалобы, 48 страниц и карточка дела лежат открыто, читаются без регистрации.
Самое полезное в этой истории - не сумма требований и даже не фамилии в шапке иска. Вопрос сместился с «можно ли обучать на чужом» на «сможете ли вы через три года объяснить, откуда у вас эти файлы».
А вы сможете назвать источник и лицензию для каждого набора данных, на котором учили или файнтюнили? Расскажите, чем ведёте учёт - или чем собираетесь.