15 जुलाई 2026 को Suno का आंतरिक स्रोत कोड सार्वजनिक रूप से उपलब्ध हो गया — जो कि AI पर आधारित सबसे बड़े संगीत जनरेटर में से एक है। इस लीक ने वह किया, जिसकी वर्षों से वादी अदालतों में मांग कर रहे थे: यह सटीक आंकड़ों के साथ दिखाता है कि सेवा ने प्रशिक्षण के लिए डेटा कहां से लिया। उत्तर — पूरे इंटरनेट से, औद्योगिक स्क्रैपिंग के माध्यम से, उस पैमाने पर जो बिना प्रॉक्सी इंफ्रास्ट्रक्चर के भौतिक रूप से असंभव है। हम समझते हैं कि वास्तव में क्या उजागर हुआ और क्यों यह कहानी AI उद्योग की नींव के बारे में है, न कि केवल एक सेवा के बारे में।
क्या हुआ: हैक ने Suno की रसोई को उजागर किया
404 मीडिया और TechCrunch के अनुसार, हैकर ellie.191 ने नवंबर 2025 में आपूर्ति श्रृंखला पर हमले के माध्यम से Suno की प्रणालियों तक पहुंच प्राप्त की — शै-हुलुद नामक वर्म, जो GitHub और क्लाउड सेवाओं के क्रेडेंशियल्स को इकट्ठा करता है। एक कर्मचारी के खाते से समझौता करते हुए, हमलावर ने स्रोत कोड और आंतरिक कॉन्फ़िगरेशन को लीक कर दिया, साथ ही Suno के सैकड़ों हजारों ग्राहकों की जानकारी और Stripe से भुगतान विवरण (ईमेल, फोन, कार्ड नंबर के हिस्से) भी।
यह घटना 2025 के अंत में हुई, लेकिन Suno ने उपयोगकर्ताओं को सूचित नहीं किया और अभी भी इसे "एक सीमित सुरक्षा घटना, जिसे जल्दी से स्थानीयकृत किया गया" कहता है। सार्वजनिक रूप से सामग्री केवल अब, जुलाई 2026 में सामने आई है, — और लीक की मुख्य मूल्यवानता व्यक्तिगत डेटा में नहीं है, बल्कि कोड में टिप्पणियों में है, जहां स्रोतों और प्रशिक्षण डेटासेट के आकार की सूची दी गई है।
संख्याएँ, जिन्हें दिखाने की योजना नहीं थी
पहले Suno ने अस्पष्ट शब्दों में बात की — प्रशिक्षण "वास्तव में सभी स्वीकार्य गुणवत्ता के संगीत फ़ाइलों पर हो रहा था, जो खुले इंटरनेट पर उपलब्ध हैं", यह "दशकों मिलियन रिकॉर्ड" है। लीक हुआ कोड अस्पष्टता को विशिष्टता में बदल देता है। यहाँ वास्तव में मॉडल में क्या डाला गया:
- YouTube Music — 2,013,545 संगीत वीडियो, 113,879 घंटे; अलग से चिह्नित संग्रह "YTM Tagged" — और 152,162 घंटे;
- Pond5 (स्टॉक संगीत) — 62,117 घंटे;
- IMSLP (International Music Score Library Project, संगीत नोटों की लाइब्रेरी) — 19,514 घंटे;
- Genius (गाने के बोल) — 17,615 घंटे;
- Deezer — 12,287 घंटे;
- Jamendo — 3,726 घंटे;
- Freesound — 410 घंटे;
- MuseScore — बोल और नोट्स;
- RSS के माध्यम से पॉडकास्ट — कोड ने लगभग 420,000 पॉडकास्ट को चिह्नित किया, जिनमें से पांच और अधिक एपिसोड 30 मिनट से लंबे हैं, लगभग 1 मिलियन घंटे ऑडियो निकालने के लक्ष्य के साथ।
कोड में टिप्पणियाँ व्याख्याओं के लिए कोई जगह नहीं छोड़ती हैं: प्रणाली ने "genius_hq, youtube_music, freesound, jamendo, imslp, deezer, ytm_tagged" से डेटा खींचा, और "गैर-संगीत सामग्री को पोस्ट-प्रोसेसिंग में फ़िल्टर किया गया"। ये कोई ग्रे क्षेत्र नहीं हैं और न ही आकस्मिक लोडिंग हैं — यह पूरे उपलब्ध वेब से डेटा संग्रह का एक डिज़ाइन किया गया कन्वेयर है।
क्यों ऐसा प्रॉक्सी के बिना असंभव है
एक महत्वपूर्ण विवरण, जिसे बड़े आंकड़ों के पीछे छोड़ना आसान है: YouTube Music, Deezer और अधिकांश स्ट्रीमिंग प्लेटफार्मों ने बड़े पैमाने पर डाउनलोडिंग के खिलाफ आक्रामक रूप से सुरक्षा की है। IP पर कठोर अनुरोध सीमाएँ, व्यवहारिक और TLS-फिंगरप्रिंटिंग, कैप्चा, रेंज बैन — ये सब बातें हैं जिनके बारे में हम नियमित रूप से लिखते हैं। दो मिलियन वीडियो और सैकड़ों हजारों घंटे ऑडियो को एक या यहां तक कि सैकड़ों पते से खींचना असंभव है: प्लेटफॉर्म की इंफ्रास्ट्रक्चर पहले हजारों अनुरोधों पर स्रोत को ब्लॉक कर देगी।
इस पैमाने के कन्वेयर को महीनों तक चलाने के लिए, हजारों विभिन्न IP की रोटेशन की आवश्यकता होती है, जो वास्तविक उपयोगकर्ताओं की तरह दिखते हैं — अर्थात् रिसिडेंशियल और मोबाइल प्रॉक्सी। डेटा सेंटर के पते लोकप्रिय स्ट्रीमिंग पर ASN द्वारा लगभग तुरंत ब्लॉक कर दिए जाते हैं। डाउनलोडिंग का तंत्र इस प्रकार मानक है — प्रॉक्सी-लेयर के साथ yt-dlp जैसी लिंक; हमने इसे YouTube से yt-dlp और प्रॉक्सी के माध्यम से डाउनलोड करने के लिए गाइड में विस्तार से समझाया है। Suno का लीक एक दुर्लभ मामला है, जब बाहर से इस "अदृश्य नींव" के पैमाने को देखा गया: स्वयं मॉडल एक शोकेस है, और इसके नीचे वर्षों से प्रॉक्सी फार्म चल रही है, जो औद्योगिक मात्रा में सामग्री को खींच रही है।
यह भी समझाता है कि क्यों 2026 में प्रॉक्सी का बाजार AI के लिए एक इंफ्रास्ट्रक्चर के रूप में देखा जाने लगा, न कि स्क्रैपर्स के लिए एक निचे उपकरण के रूप में। कोई भी बड़ा प्रशिक्षण डेटासेट — संगीत, पाठ, वीडियो — सबसे पहले डेटा संग्रह की लॉजिस्टिक्स है: हजारों IP, डिटेक्ट को बायपास करना, लोड का वितरण। यदि आप इस परत को गहराई से समझना चाहते हैं, तो हमारे पास AI प्रशिक्षण और डेटासेट संग्रह के लिए प्रॉक्सी पर एक अलग विश्लेषण है।
कानूनी खतरा: मामला प्रॉक्सी का नहीं, बल्कि यह है कि क्या और कहां से
Suno पहले भी बड़े लेबलों के साथ मुकदमा कर चुका है, और लीक उनकी स्थिति को मजबूत करता है। कंपनी अच्छे विश्वास के उपयोग के सिद्धांत (fair use) का बचाव करती है: यह कहती है कि सार्वजनिक रूप से उपलब्ध संगीत पर प्रशिक्षण करना कानूनी है। लेकिन अधिकार धारकों के पास एक गंभीर तर्क है जो कॉपीराइट से अधिक है — DMCA। उनका तर्क: YouTube से औद्योगिक मात्रा में स्क्रैपिंग का मतलब है तकनीकी सुरक्षा उपायों को बायपास करना, जो प्लेटफॉर्म ने स्वचालित डाउनलोडिंग के खिलाफ लगाए हैं। और ऐसे उपायों को बायपास करना एक अलग उल्लंघन है, भले ही अंततः विवाद का निष्कर्ष क्या हो। इसी तरह की दलीलों के साथ Suno के प्रतिद्वंद्वी Udio के खिलाफ भी मुकदमे चल रहे हैं, जिसे YouTube के समान स्क्रैपिंग का आरोप लगाया गया है।
डेटा संग्रह करने वालों के लिए निष्कर्ष वही है जो GDPR के तहत स्क्रैपिंग पर EDPB के दिशानिर्देशों के मामले में है: प्रॉक्सी तकनीकी पहुंच की समस्या को हल करती हैं, लेकिन कानूनी आधार प्रदान नहीं करतीं। रिसिडेंशियल IP आपको सामान्य आगंतुक की तरह दिखाता है — यह प्लेटफॉर्म के उपयोग की शर्तों, कॉपीराइट और DMCA को रद्द नहीं करता। कानूनी परिधि इस बात से निर्धारित होती है कि आप क्या और क्यों इकट्ठा कर रहे हैं, न कि इस बात से कि आपका ट्रैफ़िक कितना साफ दिखता है।
इससे क्या लेना है
भले ही आपने कभी AI के लिए संगीत एकत्र नहीं किया हो, Suno का मामला 2026 में डेटा संग्रह के बारे में एक संकुचित पाठ है:
- स्केल प्रॉक्सी पर निर्भर करता है। स्ट्रीमिंग और सुरक्षित प्लेटफार्मों से किसी भी गंभीर संग्रह के लिए रेजिडेंशियल या मोबाइल IP की रोटेशन की आवश्यकता होती है — डेटा सेंटर मिनटों में ASN द्वारा ब्लॉक कर दिए जाते हैं। प्रॉक्सी का प्रकार उद्देश्य के अनुसार चुना जाता है: व्यापक वेब के लिए रेजिडेंशियल, सबसे आक्रामक एंटी-बॉट सिस्टम के लिए मोबाइल।
- तकनीकी पहुंच ≠ अधिकार। एंटी-स्क्रैपिंग सुरक्षा को बायपास करना DMCA और उपयोग की शर्तों का उल्लंघन हो सकता है। तकनीकी बाधाओं के बिना खुले डेटा को उस सामग्री से अलग करें जो सुरक्षा के पीछे है — ये जोखिम के विभिन्न स्तर हैं।
- प्रॉक्सी की स्वच्छता और उत्पत्ति महत्वपूर्ण हैं। NetNut जैसे बॉटनेट के समाप्त होने के बीच, रेजिडेंशियल IP की उत्पत्ति चयन का मानदंड बन गई है: एक पारदर्शी प्रदाता से स्वच्छ पूल — यह स्थिरता और कानूनी जोखिमों को कम करता है।
- डेटा विधियों के साथ लीक होते हैं। Suno ने वर्षों तक सीधे स्क्रैपिंग से इनकार किया — और एक हैक ने सभी शब्दों को शून्य कर दिया। अपने पाइपलाइन को इस तरह बनाएं जैसे कि इसे कल अदालत में पढ़ा जाएगा।
निष्कर्ष
Suno का हैक व्यक्तिगत डेटा में नहीं, बल्कि इस बात में दिलचस्प है कि इसने पहली बार एक बड़े AI उत्पाद की आंतरिक स्थिति को विशिष्ट संख्याओं में दिखाया: YouTube Music से 2,013,545 वीडियो, दर्जनों स्रोत, पॉडकास्ट के लिए एक मिलियन घंटे की योजनाएँ। इन आंकड़ों के पीछे — कोई जादू नहीं है, बल्कि डेटा संग्रह की साधारण लॉजिस्टिक्स है: प्रॉक्सी फार्म, डिटेक्ट को बायपास करना, महीनों तक खींचना। पिछले कुछ वर्षों की AI दौड़ मुख्य रूप से डेटा के लिए दौड़ है, और डेटा के लिए दौड़ का मतलब है पहुंच की इंफ्रास्ट्रक्चर के लिए दौड़। Suno बस वह था जिसने इस इंफ्रास्ट्रक्चर को देखा।
यदि आप कानूनी डेटा संग्रह कर रहे हैं — विश्लेषण, मॉडल प्रशिक्षण या निगरानी के लिए — तो सही नींव पर शुरू करें: स्वच्छ रिसिडेंशियल और मोबाइल प्रॉक्सी के साथ पारदर्शी उत्पत्ति। पहुंच की तकनीक हल करने योग्य है; मुख्य बात यह है कि इसे कानून और सामान्य ज्ञान के दायरे में रखना है।
```