2026年7月15日、Sunoの内部ソースコードが公開されました。これは、AIベースの音楽生成器の中で最大のものの一つです。この漏洩は、原告が長年求めてきたことを実現しました。それは、サービスがどこからデータを取得していたのかを正確な数字で示したことです。答えは、インターネット全体から、プロキシインフラなしでは物理的に不可能な規模での産業的スクレイピングです。何が明らかになったのか、そしてなぜこの話がAI業界全体の基盤に関するものであり、単なる一つのサービスに関するものではないのかを見ていきましょう。
何が起こったのか:Sunoの内部事情が明らかに
404 MediaとTechCrunchによると、ハッカーのellie.191は、2025年11月にサプライチェーン攻撃を通じてSunoのシステムにアクセスしました。これは、GitHubやクラウドサービスの認証情報を収集するShai-Huludというワームによるものでした。攻撃者は従業員のアカウントを侵害し、ソースコードや内部設定をダウンロードし、Sunoの数十万の顧客情報やStripeからの支払い情報(メール、電話番号、カード番号の一部)を持ち去りました。
この事件自体は2025年末に発生しましたが、Sunoはユーザーに通知せず、今でもこれを「迅速に封じ込められた限られたセキュリティインシデント」と呼んでいます。公に資料が浮上したのは、2026年7月になってからであり、漏洩の主な価値は個人データではなく、コードのコメントにあり、そこにはトレーニングデータセットのソースとボリュームが列挙されています。
見せたくなかった数字
以前、Sunoは「オープンインターネット上で入手可能な質の高い音楽ファイルのほぼすべて」でトレーニングを行っていると、曖昧な表現で逃げていました。それは「数千万のレコード」です。漏洩したコードは、その曖昧さを具体性に置き換えました。実際にモデルに流し込まれたものは以下の通りです:
- YouTube Music — 2,013,545のミュージックビデオ、113,879時間;別途、ラベル付けされた「YTM Tagged」コーパス — さらに152,162時間;
- Pond5(ストック音楽) — 62,117時間;
- IMSLP(国際楽譜ライブラリープロジェクト) — 19,514時間;
- Genius(歌詞) — 17,615時間;
- Deezer — 12,287時間;
- Jamendo — 3,726時間;
- Freesound — 410時間;
- MuseScore — 歌詞と楽譜;
- ポッドキャスト(RSS経由) — コードは約420,000のポッドキャストを抽出し、30分以上のエピソードが5つ以上あるものを対象に、約1百万時間のオーディオを取得することを目指しました。
コード内のコメントは解釈の余地を残しません:システムは「genius_hq、youtube_music、freesound、jamendo、imslp、deezer、ytm_tagged」からデータを引き出しており、「非音楽コンテンツは後処理でフィルタリングされました」。これはグレーゾーンでも偶発的なアップロードでもなく、利用可能なウェブ全体からのデータ収集のために設計されたコンベヤーです。
なぜプロキシなしでは不可能なのか
見逃しがちな重要な点は、YouTube Music、Deezer、そしてほとんどのストリーミングプラットフォームは、大量ダウンロードから積極的に保護されているということです。IPごとのリクエスト制限、行動分析、TLSフィンガープリンティング、CAPTCHA、IPレンジの禁止 — これらは私たちが定期的に書いていることです。200万のクリップと数十万時間のオーディオを一つまたは数百のアドレスからダウンロードすることは不可能です:プラットフォームのインフラは最初の数千のリクエストでソースをブロックします。
この規模のコンベヤーが数ヶ月間機能するためには、実際のユーザーのように見える数千の異なるIPのローテーションが必要です。つまり、レジデンシャルおよびモバイルプロキシです。データセンターのアドレスは、人気のあるストリーミングサービスではほぼ即座にASNによってブロックされます。ダウンロードのメカニズムは一般的で、プロキシレイヤーを持つyt-dlpのような組み合わせです;私たちはそれをYouTubeからyt-dlpとプロキシを使ってブロックを回避する方法のガイドで詳しく説明しました。Sunoの漏洩は、この「見えない基盤」の規模を外部から見ることができる稀なケースです:モデル自体はショーケースであり、その下で何年もプロキシファームが稼働しており、産業規模でコンテンツを引き出しています。
これが、2026年にプロキシ市場がAIのためのインフラとして認識されるようになった理由でもあります。大規模なトレーニングデータセット — 音楽、テキスト、ビデオ — は、まず第一に収集のロジスティクスです:数千のIP、検出回避、負荷分散です。この層をより深く理解したい場合は、私たちのAIトレーニングとデータセット収集のためのプロキシに関する別の分析があります。
法的な地雷:問題はプロキシではなく、何をどこから
Sunoは以前にも大手レコード会社と訴訟を起こしており、漏洩は彼らの立場を強化しています。会社は公正利用の原則(fair use)で防御しています:つまり、公開されている音楽でのトレーニングは合法だということです。しかし、著作権者には著作権よりも強力な武器があります — DMCAです。彼らの主張は、YouTubeからの産業規模でのスクレイピングは、自動ダウンロードに対してプラットフォームが設けた技術的保護手段を回避することを意味するというものです。そして、そのような手段を回避することは、最終的に公正利用に関する争いがどのように終わるかに関係なく、別の違反となります。同様の道をたどって、Sunoの競合であるUdioサービスに対する訴訟も進行中で、YouTubeの同様のスクレイピングが非難されています。
データを収集するすべての人にとっての結論は、GDPRに基づくスクレイピングに関するEDPBのガイドラインの話と同じです:プロキシはアクセスの技術的な問題を解決しますが、法的根拠を提供するわけではありません。レジデンシャルIPは、あなたを普通の訪問者のように見せますが、プラットフォームの利用規約、著作権、DMCAを無効にするわけではありません。法的な範囲は、あなたが何を、なぜ収集するかによって決まります。あなたのトラフィックがどれほどクリーンに見えるかではなく。
何を自分に持ち帰るべきか
たとえあなたがAIのために音楽を収集したことがなくても、Sunoのケースは2026年のデータ収集に関する濃縮された教訓です:
- スケールはプロキシに依存している。ストリーミングや保護されたプラットフォームからの真剣な収集には、レジデンシャルまたはモバイルIPのローテーションが必要です — データセンターは数分でASNによってブロックされます。プロキシの種類は目的に応じて選択されます:広範なウェブにはレジデンシャル、最も攻撃的なアンチボットシステムにはモバイルです。
- 技術的なアクセス ≠ 権利。アンチスクレイピング保護を回避することは、DMCAおよび利用規約の違反と見なされる可能性があります。技術的障壁のないオープンデータを保護されたコンテンツから分けて考えること — これは異なるリスクレベルです。
- プロキシの衛生状態と出所は重要です。NetNutのようなボットネットの排除に伴い、レジデンシャルIPの出所は選択基準となりました:透明なプロバイダーからのクリーンプールは、安定性と法的リスクの低減をもたらします。
- データは手法と共に漏洩する。Sunoは長年にわたり直接的なスクレイピングを否定していましたが、一度のハッキングでそのすべての表現が無効になりました。パイプラインを構築する際は、明日法廷で読まれるかのように構築してください。
結論
Sunoのハッキングは、個人データではなく、大規模なAI製品の裏側を具体的な数字で初めて示した点で興味深いです:YouTube Musicからの2,013,545のクリップ、数十のソース、計画中の百万時間のポッドキャスト。これらの数字の背後には、ニューラルネットワークの魔法ではなく、単純な収集のロジスティクスがあります:プロキシファーム、検出回避、数ヶ月のダウンロード。近年のAI競争は、データの競争であり、データの競争はアクセスインフラの競争です。Sunoは、このインフラを見せることができた唯一の存在でした。
もしあなたが合法的なデータ収集を行っているなら — 分析、モデルのトレーニング、またはモニタリングのために — 正しい基盤から始めてください:透明な出所のクリーンなレジデンシャルおよびモバイルプロキシです。アクセスの技術は解決可能ですが、重要なのはそれを法律と常識の範囲内に保つことです。
