Quay lại blog

Vụ lừa đảo Suno tiết lộ bí mật AI-scraping: 2 triệu video từ YouTube Music và vai trò của proxy

Vào ngày 15 tháng 7 năm 2026, mã Suno bị rò rỉ đã chỉ ra con số chính xác về nguồn dữ liệu mà trình tạo nhạc AI đã sử dụng: 2 013 545 video từ YouTube Music, Deezer, Genius, kho nhạc và một triệu giờ podcast. Đằng sau những con số này không phải là phép thuật của mạng nơ-ron, mà là một trang trại proxy và việc vượt qua các biện pháp bảo vệ chống lại việc thu thập dữ liệu. Chúng ta sẽ phân tích quy mô, mặt kỹ thuật và quả bom pháp lý DMCA.

📅20 tháng 7, 2026
Vụ lừa đảo Suno tiết lộ bí mật AI-scraping: 2 triệu video từ YouTube Music và vai trò của proxy

Ngày 15 tháng 7 năm 2026, mã nguồn nội bộ của Suno - một trong những trình tạo nhạc lớn nhất dựa trên AI - đã bị rò rỉ ra công chúng. Sự rò rỉ này đã làm điều mà các nguyên đơn đã nỗ lực trong nhiều năm tại tòa án: cho thấy bằng những con số chính xác, dịch vụ đã lấy dữ liệu để đào tạo từ đâu. Câu trả lời - từ khắp nơi trên internet, thông qua việc thu thập dữ liệu quy mô công nghiệp, điều mà về mặt vật lý là không thể thực hiện được nếu không có cơ sở hạ tầng proxy. Chúng ta cùng tìm hiểu xem điều gì đã được tiết lộ và tại sao câu chuyện này lại liên quan đến lớp nền của toàn bộ ngành công nghiệp AI, chứ không chỉ là một dịch vụ duy nhất.

Điều gì đã xảy ra: vụ hack đã phơi bày nội bộ của Suno

Theo 404 MediaTechCrunch, một hacker có biệt danh ellie.191 đã truy cập vào hệ thống của Suno từ tháng 11 năm 2025 thông qua một cuộc tấn công vào chuỗi cung ứng - worm Shai-Hulud, thu thập thông tin đăng nhập GitHub và các dịch vụ đám mây. Sau khi xâm nhập tài khoản của một nhân viên, kẻ tấn công đã tải xuống mã nguồn và cấu hình nội bộ, cùng với đó là thông tin về hàng trăm nghìn khách hàng của Suno và dữ liệu thanh toán từ Stripe (email, số điện thoại, một phần số thẻ).

Vụ việc xảy ra vào cuối năm 2025, nhưng Suno không thông báo cho người dùng và vẫn gọi đây là "một sự cố an ninh hạn chế, đã được khắc phục nhanh chóng". Tài liệu công khai chỉ mới xuất hiện vào tháng 7 năm 2026 - và giá trị chính của sự rò rỉ không nằm ở dữ liệu cá nhân, mà ở các chú thích trong mã, nơi liệt kê các nguồn và khối lượng của bộ dữ liệu đào tạo.

Các con số mà họ không định công bố

Trước đây, Suno thường sử dụng những cụm từ mơ hồ - đào tạo dựa trên "hầu hết tất cả các tệp nhạc có chất lượng chấp nhận được, có sẵn trên internet công khai", đó là "hàng chục triệu bản ghi". Mã bị rò rỉ đã thay thế sự mơ hồ bằng sự cụ thể. Đây là những gì thực sự đã được đưa vào mô hình:

  • YouTube Music - 2 013 545 video âm nhạc, 113 879 giờ; một bộ dữ liệu được gán nhãn riêng "YTM Tagged" - thêm 152 162 giờ;
  • Pond5 (nhạc stock) - 62 117 giờ;
  • IMSLP (Thư viện Bảng nhạc Quốc tế) - 19 514 giờ;
  • Genius (lời bài hát) - 17 615 giờ;
  • Deezer - 12 287 giờ;
  • Jamendo - 3 726 giờ;
  • Freesound - 410 giờ;
  • MuseScore - lời và nốt nhạc;
  • podcast qua RSS - mã đã trích xuất khoảng 420 000 podcast với năm hoặc nhiều hơn các tập dài hơn 30 phút, với mục tiêu tải xuống khoảng 1 triệu giờ âm thanh.

Các chú thích trong mã không để lại chỗ cho những cách diễn giải: hệ thống đã lấy dữ liệu từ "genius_hq, youtube_music, freesound, jamendo, imslp, deezer, ytm_tagged", trong khi "nội dung không phải nhạc đã được lọc trong quá trình xử lý sau". Đây không phải là những điểm mờ xám hay những tải lên ngẫu nhiên - đây là một dây chuyền thu thập dữ liệu được thiết kế từ khắp nơi trên web có sẵn.

Tại sao điều này không thể thực hiện được mà không có proxy

Chi tiết quan trọng mà dễ bị bỏ qua giữa những con số lớn: YouTube Music, Deezer và hầu hết các nền tảng phát trực tuyến đều được bảo vệ mạnh mẽ khỏi việc tải xuống hàng loạt. Các giới hạn nghiêm ngặt về yêu cầu trên IP, nhận diện hành vi và TLS-fingerprinting, captcha, cấm dải IP - tất cả những điều mà chúng tôi thường xuyên viết. Tải xuống hai triệu video và hàng trăm nghìn giờ âm thanh từ một hoặc thậm chí hàng trăm địa chỉ là điều không thể: cơ sở hạ tầng của nền tảng sẽ chặn nguồn ngay từ những yêu cầu đầu tiên.

Để một dây chuyền quy mô như vậy hoạt động trong nhiều tháng, cần phải có sự luân chuyển của hàng ngàn IP khác nhau, trông giống như người dùng thực - tức là proxy dân cưproxy di động. Các địa chỉ từ trung tâm dữ liệu trên các nền tảng phát trực tuyến phổ biến sẽ bị chặn ngay lập tức theo ASN. Cơ chế tải xuống này là điển hình - một liên kết như yt-dlp với lớp proxy; chúng tôi đã phân tích chi tiết trong hướng dẫn cách tải xuống từ YouTube qua yt-dlp và proxy để vượt qua các chặn. Sự rò rỉ của Suno là một trường hợp hiếm hoi, nơi có thể nhìn thấy quy mô của "lớp nền vô hình" này: chính mô hình - là một mặt tiền, và bên dưới nó là một trang trại proxy đã hoạt động trong nhiều năm, kéo nội dung với quy mô công nghiệp.

Điều này cũng giải thích tại sao thị trường proxy vào năm 2026 đã được coi là cơ sở hạ tầng cho AI, chứ không phải là một công cụ ngách cho các scraper. Bất kỳ bộ dữ liệu đào tạo lớn nào - âm nhạc, văn bản, video - trước hết là logistics thu thập: hàng ngàn IP, vượt qua phát hiện, phân phối tải. Nếu bạn muốn hiểu sâu hơn về lớp này, chúng tôi có một phân tích riêng proxy cho đào tạo AI và thu thập bộ dữ liệu.

Địa lý pháp lý: vấn đề không phải là proxy, mà là cái gì và từ đâu

Suno trước đây đã kiện các hãng thu âm lớn, và sự rò rỉ này củng cố vị thế của họ. Công ty bảo vệ mình bằng học thuyết sử dụng hợp lý (fair use): rằng việc đào tạo trên nhạc công khai là hợp pháp. Nhưng các chủ sở hữu bản quyền có một lá bài mạnh hơn quyền tác giả - DMCA. Lập luận của họ: việc thu thập dữ liệu từ YouTube với quy mô công nghiệp có nghĩa là vượt qua các biện pháp bảo vệ kỹ thuật mà nền tảng đã thiết lập để chống lại việc tải xuống tự động. Và việc vượt qua những biện pháp này - là một vi phạm riêng, bất kể tranh chấp về việc sử dụng hợp lý kết thúc như thế nào. Các vụ kiện tương tự cũng đang diễn ra đối với đối thủ của Suno - dịch vụ Udio, bị cáo buộc có hành vi thu thập tương tự từ YouTube.

Kết luận cho tất cả những ai thu thập dữ liệu ở đây cũng giống như trong câu chuyện với hướng dẫn EDPB về thu thập dữ liệu theo GDPR: proxy giải quyết vấn đề kỹ thuật về quyền truy cập, nhưng không cung cấp cơ sở pháp lý. IP dân cư khiến bạn trông giống như một người truy cập bình thường - nó không hủy bỏ các điều khoản sử dụng của nền tảng, quyền tác giả và DMCA. Ranh giới pháp lý được xác định bởi CÁI GÌ và TẠI SAO bạn thu thập, chứ không phải bởi mức độ sạch sẽ của lưu lượng truy cập của bạn.

Cái gì có thể rút ra từ điều này

Ngay cả khi bạn chưa bao giờ thu thập nhạc cho AI, trường hợp của Suno là một bài học cô đọng về thu thập dữ liệu vào năm 2026:

  1. Quy mô phụ thuộc vào proxy. Bất kỳ thu thập nghiêm túc nào từ các nền tảng phát trực tuyến và bảo vệ đều yêu cầu IP dân cư hoặc di động với sự luân chuyển - trung tâm dữ liệu sẽ bị chặn theo ASN chỉ trong vài phút. Loại proxy được chọn dựa trên mục tiêu: dân cư cho web rộng, di động - cho các hệ thống chống bot mạnh mẽ nhất.
  2. Quyền truy cập kỹ thuật ≠ quyền hợp pháp. Việc vượt qua các biện pháp bảo vệ chống thu thập dữ liệu có thể được coi là vi phạm DMCA và điều khoản sử dụng. Hãy tách biệt dữ liệu công khai không có rào cản kỹ thuật khỏi nội dung được bảo vệ - đó là những mức độ rủi ro khác nhau.
  3. Vệ sinh và nguồn gốc của proxy là quan trọng. Trong bối cảnh việc loại bỏ các botnet như NetNut, nguồn gốc của IP dân cư đã trở thành tiêu chí lựa chọn: một nguồn sạch từ nhà cung cấp minh bạch - đó là sự ổn định và giảm thiểu rủi ro pháp lý.
  4. Dữ liệu rò rỉ cùng với các phương pháp. Suno đã từ chối việc thu thập trực tiếp trong nhiều năm - và một vụ hack đã làm mất hiệu lực tất cả các cụm từ. Hãy xây dựng pipeline như thể nó sẽ được đọc tại tòa án vào ngày mai.

Kết luận

Vụ hack Suno thú vị không phải vì dữ liệu cá nhân, mà vì nó lần đầu tiên cho thấy mặt trái của một sản phẩm AI lớn qua những con số cụ thể: 2 013 545 video từ YouTube Music, hàng chục nguồn, một triệu giờ podcast trong kế hoạch. Đằng sau những con số này không phải là phép thuật của mạng nơ-ron, mà là logistics thu thập đơn giản: trang trại proxy, vượt qua phát hiện, tháng ngày tải xuống. Cuộc đua AI trong những năm gần đây chủ yếu là cuộc đua giành dữ liệu, và cuộc đua giành dữ liệu là cuộc đua về cơ sở hạ tầng truy cập. Suno chỉ đơn giản là người đã có được cơ sở hạ tầng này.

Nếu bạn đang xây dựng việc thu thập dữ liệu hợp pháp - cho phân tích, đào tạo mô hình hoặc giám sát - hãy bắt đầu với lớp nền đúng đắn: proxy dân cưproxy di động với nguồn gốc minh bạch. Kỹ thuật truy cập có thể giải quyết; điều quan trọng là giữ nó trong khuôn khổ pháp luật và lý trí.