Назад к блогу

Взлом Suno раскрыл кухню AI-скрапинга: 2 миллиона клипов с YouTube Music и при чём тут прокси

15 июля 2026 утёкший код Suno показал точными цифрами, откуда генератор музыки на ИИ брал данные: 2 013 545 клипов YouTube Music, Deezer, Genius, стоки и миллион часов подкастов. За этими цифрами — не магия нейросети, а прокси-ферма и обход анти-скрапинг-защит. Разбираем масштаб, техническую изнанку и юридическую мину DMCA.

📅20 июля 2026 г.
Взлом Suno раскрыл кухню AI-скрапинга: 2 миллиона клипов с YouTube Music и при чём тут прокси

15 июля 2026 года в открытый доступ попал внутренний исходный код Suno — одного из крупнейших генераторов музыки на базе ИИ. Утечка сделала то, чего годами добивались истцы в судах: показала точными цифрами, откуда сервис брал данные для обучения. Ответ — со всего интернета, промышленным скрапингом, в масштабе, который физически невозможен без прокси-инфраструктуры. Разбираемся, что именно вскрылось и почему эта история — про несущий слой всей индустрии ИИ, а не только про один сервис.

Что случилось: взлом обнажил кухню Suno

По данным 404 Media и TechCrunch, хакер под ником ellie.191 получил доступ к системам Suno ещё в ноябре 2025 года через атаку на цепочку поставок — червя Shai-Hulud, который собирает учётные данные GitHub и облачных сервисов. Скомпрометировав аккаунт сотрудника, атакующий выгрузил исходный код и внутренние конфиги, а вместе с ними — информацию о сотнях тысяч клиентов Suno и платёжные данные из Stripe (email, телефоны, части номеров карт).

Сам инцидент произошёл в конце 2025-го, но Suno не уведомил пользователей и до сих пор называет это «ограниченным инцидентом безопасности, который быстро локализовали». Публично материалы всплыли только сейчас, в июле 2026-го, — и главная ценность утечки не в персональных данных, а в комментариях к коду, где перечислены источники и объёмы обучающего датасета.

Цифры, которые не собирались показывать

Раньше Suno отделывался обтекаемыми формулировками — обучение шло на «по сути всех музыкальных файлах приемлемого качества, доступных в открытом интернете», это «десятки миллионов записей». Утёкший код заменил обтекаемость на конкретику. Вот что реально вливалось в модель:

  • YouTube Music2 013 545 музыкальных клипов, 113 879 часов; отдельный размеченный корпус «YTM Tagged» — ещё 152 162 часа;
  • Pond5 (сток-музыка) — 62 117 часов;
  • IMSLP (International Music Score Library Project, нотная библиотека) — 19 514 часов;
  • Genius (тексты песен) — 17 615 часов;
  • Deezer — 12 287 часов;
  • Jamendo — 3 726 часов;
  • Freesound — 410 часов;
  • MuseScore — тексты и ноты;
  • подкасты через RSS — код выделил около 420 000 подкастов с пятью и более эпизодами длиннее 30 минут, с целью выкачать порядка 1 миллиона часов аудио.

Комментарии в коде не оставляют места для трактовок: система тянула данные из «genius_hq, youtube_music, freesound, jamendo, imslp, deezer, ytm_tagged», а «немузыкальный контент отфильтровывался» на постобработке. Это не серые пятна и не случайные загрузки — это спроектированный конвейер сбора данных со всего доступного веба.

Почему такое невозможно без прокси

Ключевая деталь, которую легко упустить за громкими цифрами: YouTube Music, Deezer и большинство стриминговых площадок агрессивно защищаются от массового скачивания. Жёсткие лимиты запросов на IP, поведенческий и TLS-фингерпринтинг, капчи, баны диапазонов — всё то, о чём мы регулярно пишем. Стянуть два миллиона клипов и сотни тысяч часов аудио с одного или даже сотни адресов невозможно: инфраструктура площадки заблокирует источник на первых тысячах запросов.

Чтобы конвейер такого масштаба работал месяцами, нужна ротация тысяч разных IP, выглядящих как реальные пользователи, — то есть резидентные и мобильные прокси. Датацентровые адреса на популярных стримингах отсекаются практически сразу по ASN. Сам механизм скачивания при этом типовой — связка вроде yt-dlp с прокси-слоем; мы подробно разбирали её в гайде как скачивать с YouTube через yt-dlp и прокси в обход блокировок. Утечка Suno — редкий случай, когда со стороны видно масштаб этого «невидимого несущего слоя»: сама модель — витрина, а под ней годами крутится ферма прокси, вытягивающая контент индустриальными объёмами.

Это же объясняет, почему рынок прокси в 2026-м стал восприниматься как инфраструктура для ИИ, а не нишевый инструмент скраперов. Любой большой обучающий датасет — музыкальный, текстовый, видео — это в первую очередь логистика сбора: тысячи IP, обход детекта, распределение нагрузки. Если хотите понять этот слой глубже, у нас есть отдельный разбор прокси для обучения ИИ и сбора датасетов.

Юридическая мина: дело не в прокси, а в том, что и откуда

Suno и раньше судился с крупными лейблами, и утечка усиливает их позицию. Компания защищается доктриной добросовестного использования (fair use): мол, обучение на публично доступной музыке законно. Но у правообладателей есть козырь посерьёзнее авторского права — DMCA. Их аргумент: скрапинг с YouTube в промышленных объёмах означает обход технических мер защиты, которые площадка выставила против автоматического скачивания. А обход таких мер — это уже отдельное нарушение, независимо от того, чем в итоге закончится спор про fair use. По тем же следам идут иски против конкурента Suno — сервиса Udio, которого обвиняют в аналогичном скрапинге YouTube.

Вывод для всех, кто собирает данные, здесь тот же, что и в истории с руководством EDPB по скрапингу под GDPR: прокси решают техническую задачу доступа, но не выдают правовое основание. Резидентный IP делает вас похожим на обычного посетителя — он не отменяет условия использования площадки, авторские права и DMCA. Юридический периметр определяется тем, ЧТО и ЗАЧЕМ вы собираете, а не тем, насколько чисто выглядит ваш трафик.

Что из этого забрать себе

Даже если вы никогда не собирали музыку для ИИ, кейс Suno — концентрированный урок про сбор данных в 2026 году:

  1. Масштаб держится на прокси. Любой серьёзный сбор со стриминговых и защищённых площадок требует резидентных или мобильных IP с ротацией — датацентр отсекается по ASN за минуты. Тип прокси выбирается под цель: резидентные для широкого веба, мобильные — под самые агрессивные анти-бот-системы.
  2. Технический доступ ≠ право. Обход анти-скрапинг-защиты может квалифицироваться как нарушение DMCA и условий использования. Отделяйте открытые данные без техбарьеров от контента за защитой — это разные уровни риска.
  3. Гигиена и происхождение прокси имеют значение. На фоне ликвидации ботнетов вроде NetNut происхождение резидентных IP стало критерием выбора: чистый пул от прозрачного провайдера — это и стабильность, и снижение юридических рисков.
  4. Данные утекают вместе с методами. Suno годами отрицал прямой скрапинг — и один взлом обнулил все формулировки. Стройте пайплайн так, будто его завтра прочитают на суде.

Итог

Взлом Suno интересен не персональными данными, а тем, что впервые показал изнанку крупного ИИ-продукта в конкретных числах: 2 013 545 клипов с YouTube Music, десятки источников, миллион часов подкастов в планах. За этими цифрами — не магия нейросети, а банальная логистика сбора: прокси-ферма, обход детекта, месяцы выкачивания. ИИ-гонка последних лет — это во многом гонка за данные, а гонка за данные — это гонка инфраструктуры доступа. Suno просто оказался тем, у кого эту инфраструктуру подсмотрели.

Если вы строите легальный сбор данных — под аналитику, обучение моделей или мониторинг — начните с правильного несущего слоя: чистых резидентных и мобильных прокси с прозрачным происхождением. Техника доступа решаема; главное — держать её в рамках закона и здравого смысла.