2026년 7월 15일에 Suno의 내부 소스 코드가 공개되었습니다. Suno는 AI 기반 음악 생성기 중 하나로, 이 유출 사건은 수년간 소송을 통해 원고들이 요구했던 것을 보여주었습니다: 서비스가 학습을 위해 데이터를 어디서 가져왔는지를 정확한 숫자로 밝혀냈습니다. 그 답은 전 세계 인터넷에서, 프로시 인프라 없이는 물리적으로 불가능한 대규모 스크래핑을 통해 수집된 것입니다. 무엇이 드러났고, 왜 이 이야기가 AI 산업 전체의 기초에 관한 것인지, 단지 하나의 서비스에 관한 것이 아닌지를 알아보겠습니다.
무슨 일이 있었나: 해킹으로 Suno의 내부가 드러나다
404 Media와 TechCrunch에 따르면, ellie.191이라는 해커가 2025년 11월에 공급망 공격을 통해 Suno의 시스템에 접근했습니다. 이 공격은 GitHub 및 클라우드 서비스의 자격 증명을 수집하는 Shai-Hulud 웜을 사용했습니다. 직원의 계정을 침해한 공격자는 소스 코드와 내부 구성 파일을 다운로드했으며, 그와 함께 Suno의 수십만 고객 정보와 Stripe의 결제 데이터(이메일, 전화번호, 카드 번호의 일부)를 확보했습니다.
사건 자체는 2025년 말에 발생했지만, Suno는 사용자에게 알리지 않았고 여전히 이를 "빠르게 국한된 보안 사고"라고 부르고 있습니다. 공개 자료는 이제야, 2026년 7월에 드러났습니다. 유출의 주요 가치는 개인 데이터가 아니라, 학습 데이터 세트의 출처와 양이 나열된 코드 주석에 있습니다.
보여주고 싶지 않았던 숫자들
이전에는 Suno가 "공개 인터넷에서 접근 가능한 모든 품질의 음악 파일"에서 학습한다고 모호하게 설명했습니다. 이는 "수천만 개의 레코드"라고 했습니다. 유출된 코드는 모호함을 구체성으로 대체했습니다. 모델에 실제로 주입된 내용은 다음과 같습니다:
- YouTube Music — 2,013,545개의 뮤직 비디오, 113,879시간; 별도의 주석이 달린 "YTM Tagged" 데이터 세트 — 추가로 152,162시간;
- Pond5 (스톡 음악) — 62,117시간;
- IMSLP (국제 음악 악보 도서관 프로젝트) — 19,514시간;
- Genius (가사) — 17,615시간;
- Deezer — 12,287시간;
- Jamendo — 3,726시간;
- Freesound — 410시간;
- MuseScore — 가사 및 악보;
- RSS를 통한 팟캐스트 — 코드가 약 420,000개의 팟캐스트를 추출했으며, 각 팟캐스트는 30분 이상인 5개 이상의 에피소드를 포함하여 약 1백만 시간의 오디오를 확보할 계획이었습니다.
코드의 주석은 해석의 여지를 남기지 않습니다: 시스템은 "genius_hq, youtube_music, freesound, jamendo, imslp, deezer, ytm_tagged"에서 데이터를 끌어왔으며, "비음악 콘텐츠는 후처리에서 필터링되었습니다." 이는 회색 지대나 우연한 업로드가 아니라, 사용 가능한 웹에서 데이터를 수집하기 위해 설계된 컨베이어 벨트입니다.
프록시 없이는 불가능한 이유
눈에 띄는 숫자 뒤에 쉽게 간과할 수 있는 핵심 사항: YouTube Music, Deezer 및 대부분의 스트리밍 플랫폼은 대량 다운로드에 대해 공격적으로 방어하고 있습니다. IP에 대한 엄격한 요청 한도, 행동 및 TLS 핑거프린팅, CAPTCHA, IP 범위 차단 등은 우리가 정기적으로 언급하는 내용입니다. 두 백만 개의 비디오와 수십만 시간의 오디오를 하나의 주소 또는 심지어 수십 개의 주소에서 다운로드하는 것은 불가능합니다: 플랫폼의 인프라는 첫 번째 수천 개의 요청에서 출처를 차단합니다.
이러한 규모의 컨베이어가 수개월 동안 작동하려면, 실제 사용자처럼 보이는 수천 개의 다양한 IP가 필요합니다. 즉, 레지던셜 및 모바일 프록시가 필요합니다. 인기 있는 스트리밍 서비스에서 데이터 센터 주소는 거의 즉시 ASN에 의해 차단됩니다. 다운로드 메커니즘은 일반적이며, yt-dlp와 프록시 레이어의 조합과 같은 형태입니다; 우리는 YouTube에서 yt-dlp와 프록시를 사용하여 차단을 우회하는 방법에 대한 가이드에서 이를 자세히 설명했습니다. Suno의 유출은 이 "보이지 않는 기초층"의 규모를 외부에서 볼 수 있는 드문 사례입니다: 모델 자체는 진열대이며, 그 아래에는 수년 동안 콘텐츠를 산업 규모로 끌어오는 프록시 농장이 돌아가고 있습니다.
이것은 2026년 프록시 시장이 스크래퍼의 틈새 도구가 아닌 AI를 위한 인프라로 인식되는 이유를 설명합니다. 모든 대규모 학습 데이터 세트 — 음악, 텍스트, 비디오 —는 우선 데이터 수집의 물류입니다: 수천 개의 IP, 탐지 우회, 부하 분산. 이 층을 더 깊이 이해하고 싶다면, 우리는 AI 학습 및 데이터 세트 수집을 위한 프록시에 대한 별도의 분석을 제공합니다.
법적 지뢰: 문제는 프록시가 아니라 무엇을, 어디서 수집하느냐
Suno는 이전에도 대형 레이블과 소송을 벌였으며, 유출 사건은 그들의 입장을 강화합니다. 회사는 공정 사용(fair use) 원칙을 주장하며, 공개적으로 접근 가능한 음악에 대한 학습이 합법적이라고 주장합니다. 그러나 저작권자들은 더 심각한 카드인 DMCA를 가지고 있습니다. 그들의 주장은 산업 규모로 YouTube에서 스크래핑하는 것은 플랫폼이 자동 다운로드를 방지하기 위해 설정한 기술적 보호 조치를 우회하는 것을 의미한다는 것입니다. 이러한 조치를 우회하는 것은 공정 사용에 대한 논쟁의 결과와는 관계없이 별도의 위반 사항입니다. Suno의 경쟁자인 Udio 서비스에 대한 유사한 스크래핑 혐의로 소송이 진행되고 있습니다.
데이터를 수집하는 모든 사람에게 주는 교훈은 GDPR에 따른 스크래핑에 대한 EDPB 가이드라인의 이야기와 같습니다: 프록시는 접근의 기술적 문제를 해결하지만, 법적 근거를 제공하지는 않습니다. 레지던트 IP는 당신을 일반 방문자처럼 보이게 만들지만, 플랫폼의 이용 약관, 저작권 및 DMCA를 무효화하지는 않습니다. 법적 경계는 당신이 무엇을, 왜 수집하는지에 따라 결정되며, 당신의 트래픽이 얼마나 깨끗해 보이는지에 따라 결정되지 않습니다.
무엇을 배워야 할까
비록 당신이 AI를 위해 음악을 수집한 적이 없더라도, Suno의 사례는 2026년 데이터 수집에 대한 집중적인 교훈입니다:
- 규모는 프록시에 의존합니다. 스트리밍 및 보호된 플랫폼에서의 모든 진지한 수집은 레지던셜 또는 모바일 IP의 회전을 요구합니다 — 데이터 센터는 몇 분 만에 ASN에 의해 차단됩니다. 프록시의 유형은 목적에 따라 선택됩니다: 레지던셜은 넓은 웹을 위해, 모바일은 가장 공격적인 안티봇 시스템을 위해 사용됩니다.
- 기술적 접근 ≠ 권리. 안티 스크래핑 보호를 우회하는 것은 DMCA 및 이용 약관 위반으로 간주될 수 있습니다. 기술 장벽 없이 공개 데이터와 보호된 콘텐츠를 구분하십시오 — 이는 서로 다른 위험 수준입니다.
- 프록시의 위생과 출처가 중요합니다. NetNut과 같은 봇넷이 제거됨에 따라, 레지던셜 IP의 출처는 선택 기준이 되었습니다: 투명한 공급자로부터의 깨끗한 풀은 안정성과 법적 위험 감소를 제공합니다.
- 데이터는 방법과 함께 유출됩니다. Suno는 수년 동안 직접 스크래핑을 부인했으며, 하나의 해킹 사건이 모든 설명을 무효화했습니다. 파이프라인을 구축할 때는 내일 법원에서 읽힐 것처럼 구축하십시오.
결론
Suno의 해킹 사건은 개인 데이터가 아닌, 대규모 AI 제품의 이면을 구체적인 숫자로 처음 보여준 점에서 흥미롭습니다: YouTube Music에서 2,013,545개의 비디오, 수십 개의 출처, 계획된 백만 시간의 팟캐스트. 이러한 숫자 뒤에는 신경망의 마법이 아니라, 단순한 수집 물류가 있습니다: 프록시 농장, 탐지 우회, 수개월의 다운로드. 최근 몇 년간의 AI 경쟁은 많은 부분에서 데이터 경쟁이며, 데이터 경쟁은 접근 인프라 경쟁입니다. Suno는 단지 이 인프라를 엿본 사례에 불과합니다.
합법적인 데이터 수집을 구축하고 있다면 — 분석, 모델 학습 또는 모니터링을 위해 — 올바른 기초층에서 시작하십시오: 투명한 출처의 레지던셜 및 모바일 프록시. 접근 기술은 해결할 수 있습니다; 가장 중요한 것은 이를 법과 상식의 범위 내에서 유지하는 것입니다.
```