31 जुलाई 2026 को संघीय न्यायाधीश पोल एंगेलमेयर (न्यूयॉर्क के दक्षिणी जिले) ने Reddit के खिलाफ Perplexity AI और खोज परिणामों के एग्रीगेटर SerpApi के खिलाफ मुकदमा बंद करने से इनकार कर दिया। DMCA § 1201(a) के तहत एंटी-सर्कम्वेंशन के प्रमुख आरोपों ने खड़े रहने का काम किया - मामला आगे बढ़ रहा है। इससे ग्यारह दिन पहले, उत्तरी कैलिफोर्निया में एक अन्य संघीय न्यायाधीश ने उसी SerpApi के खिलाफ Google का लगभग समान मुकदमा खारिज कर दिया। एक ही तकनीकी बाधा, एक ही प्रतिवादी - और दो विपरीत परिणाम।
यह न्यायालयों के बीच विरोधाभास नहीं है। यह स्पष्ट संकेत है कि 2026 में स्क्रैपिंग में कानूनी सीमा वास्तव में कहां है। और यह वहां नहीं है जहां इंजीनियरों ने इसे खोजने की आदत डाली है।
31 जुलाई को न्यायालय ने क्या निर्णय लिया
मामला Reddit, Inc. v. SerpApi LLC et al. (संख्या 1:25-cv-08736) Reddit ने 22 अक्टूबर 2025 को दायर किया, और फरवरी 2026 में शिकायत का विस्तार किया। प्रतिवादियों की संख्या चार है, और उनका संयोजन महत्वपूर्ण है: AI कंपनी Perplexity AI, एग्रीगेटर SerpApi और दो प्रॉक्सी प्रदाता - Oxylabs UAB और AWMProxy।
आरोप की तर्कशक्ति यह है: मध्यस्थों ने औद्योगिक पैमाने पर Reddit की सामग्री को Reddit के सर्वरों से नहीं, बल्कि Google के खोज परिणामों से निकाला, अपने स्रोत को छिपाते हुए, ताकि सुरक्षा को दरकिनार किया जा सके; Perplexity ने इन डेटा को खरीदा और अपने AI इंजन में प्रस्तुत किया।
जज एंगेलमेयर ने आरोपों को विभाजित किया:
- खड़े रहे: DMCA § 1201(a) के तहत मुख्य आरोप - तकनीकी पहुंच नियंत्रण उपाय को दरकिनार करना। न्यायालय ने माना कि Google SearchGuard सुरक्षा तंत्र कानून के अर्थ में एक पहुंच नियंत्रण उपाय के रूप में योग्य है, और Reddit "DMCA के एंटी-सर्कम्वेंशन नियमों के हितों के क्षेत्र में" है। न्यायाधीश के शब्दों में, मंच "संरक्षित कार्यों के वैश्विक डिजिटल बाजार का प्रतिनिधित्व करता है," जिसके विकास के लिए DMCA को अपनाया गया था।
- खारिज किया गया: SerpApi के खिलाफ § 1201(b) के तहत "ट्रैफिकिंग" का आरोप, साथ ही दोनों प्रतिवादियों के खिलाफ अनुचित प्रतिस्पर्धा और बिना कारण समृद्धि के आरोप।
महत्वपूर्ण नोट: यह एक मुकदमे को खारिज करने के आवेदन पर निर्णय है, न कि मामले के विषय पर एक निर्णय। न्यायालय ने केवल कहा कि मामला सुनवाई तक जीवित रहने का अधिकार रखता है। लेकिन इस चरण पर आमतौर पर कमजोर मुकदमे स्क्रैपर्स के खिलाफ मर जाते हैं - यह नहीं मरा।
Google क्यों हारा, जबकि Reddit ने फ़िल्टर पास किया
20 जुलाई 2026 को उत्तरी कैलिफोर्निया में अध्यक्षता करने वाली न्यायाधीश इवोन गोंजालेज रोजर्स ने DMCA के तहत SerpApi के खिलाफ Google का मुकदमा खारिज कर दिया - बिना पूर्व रूप में पुनः प्रस्तुत करने के अधिकार के। हमने इस निर्णय का विस्तार से विश्लेषण किया: न्यायालय ने सहमति व्यक्त की कि ब्राउज़र फिंगरप्रिंट्स का प्रतिस्थापन, IP की रोटेशन और कैप्चा का समाधान - तकनीकी रूप से दरकिनार करना है, लेकिन दरकिनार करना अपने आप में अवैध नहीं है, यदि बाधा के पीछे कोई कॉपीराइट से संरक्षित कार्य नहीं है।
Google इसी पर ठोकर खा गया। कंपनी ने यह नहीं कहा कि उसके खोज परिणाम कॉपीराइट कानून द्वारा संरक्षित हैं, और यह नहीं दिखाया कि उसने SearchGuard को "अधिकार धारक की अनुमति से" लागू किया है, जैसा कि 17 U.S.C. § 1201(a)(3)(B) की आवश्यकता है। बाधा विज्ञापन राजस्व की रक्षा कर रही थी - और DMCA राजस्व की नहीं, बल्कि कॉपीराइट की रक्षा करता है।
Reddit ने दूसरी तरफ से प्रवेश किया। उसी SearchGuard के पीछे, Reddit के अनुसार, "सपाट अप्रासंगिक परिणाम" नहीं हैं, बल्कि उपयोगकर्ता के पोस्ट हैं - जीवित लोगों के टेक्स्ट, जिनके अधिकार Reddit लाइसेंस करता है, जिसमें Google और OpenAI के साथ वित्तीय लेनदेन शामिल हैं। अंतर तकनीक में नहीं है। अंतर यह है कि क्या वास्तव में बाधा के पीछे है।
एक निष्कर्ष जो इंजीनियरों और डेटा मालिकों को ध्यान में रखना चाहिए: क्रियाओं की तकनीकी पहचान कानूनी परिणामों की पहचान का अर्थ नहीं रखती। एक ही स्क्रिप्ट के साथ निवासी IP की रोटेशन एक मामले में - सार्वजनिक तथ्यों के साथ कानूनी काम, दूसरे में - संरक्षित कार्य की सुरक्षा को दरकिनार करना।
इस मामले में प्रॉक्सी कहां है
हमारे क्षेत्र के लिए इस मामले में सबसे दिलचस्प बात Perplexity नहीं है, बल्कि प्रतिवादियों की सूची में दो अन्य नाम हैं। Oxylabs और AWMProxy गवाहों के रूप में नहीं, और न ही "तीसरे पक्ष के उपकरण" के रूप में, बल्कि सह-प्रतिवादी के रूप में शामिल किए गए हैं: वादी का मानना है कि अज्ञातता का बुनियादी ढांचा दरकिनार करने की योजना का हिस्सा था।
Oxylabs का मुकदमा खारिज करने का आवेदन न्यायालय ने रोक दिया - क्योंकि इसके तर्कों का SerpApi और Perplexity के तर्कों के साथ महत्वपूर्ण ओवरलैप था, ब्रीफिंग को सह-प्रतिवादियों के आवेदन के समाधान तक स्थगित कर दिया गया। ये आवेदन अब हल हो गए हैं, और मूल एंटी-सर्कम्वेंशन सिद्धांत जीवित है। इसका मतलब है कि प्रॉक्सी प्रदाता की बारी आ गई है, और वह छह महीने पहले की तुलना में स्पष्ट रूप से खराब बातचीत की स्थिति में है।
मामले के दस्तावेजों से दो और विवरण, जो पैमाने और प्रमाणन के तरीकों के बारे में बहुत कुछ कहते हैं:
- न्यायालय के अनुरोध पर प्राप्त आंकड़ों के अनुसार, SerpApi ने जुलाई 2025 के दो सप्ताह में लगभग 1.8 बिलियन Google खोज परिणाम पृष्ठों तक पहुंच बनाई, जिनमें Reddit के डेटा शामिल थे।
- Reddit ने एक क्लासिक ट्रैप का उपयोग किया: सामग्री को केवल Google क्रॉलर के लिए दृश्य बनाया, और फिर उसे Perplexity के उत्तरों में पाया। यह वही प्रकार का प्रमाण है जो "वे कहीं से डेटा ले रहे हैं" के अमूर्त को विशिष्ट आपूर्ति श्रृंखला में बदल देता है।
"जहरीले प्रलोभन" की तकनीक को एक और कारण से याद रखना चाहिए। यह दिखाता है कि बड़े प्लेटफार्मों ने लंबे समय से ब्लॉक से सबूत इकट्ठा करने की ओर बढ़ना शुरू कर दिया है: चिह्नित सामग्री, हनीपॉट पृष्ठ, अद्वितीय स्निपेट। यदि आपकी सावधानी नेटवर्क स्तर पर है, तो यह मदद नहीं करती, यदि सामग्री स्वयं चिह्नित है।
मुकदमे की कमजोरियां, जिनके बारे में शायद ही कभी लिखा जाता है
Reddit ने पहले फ़िल्टर को पास किया, लेकिन उसकी स्थिति बिल्कुल भी निर्दोष नहीं है, और रक्षा दो संवेदनशील बिंदुओं पर हमला कर रही है।
पहला - पोस्टों का मालिक कौन है। Reddit की उपयोगकर्ता नीति प्रकाशनों के अधिकार लेखकों के पास रखती है, जबकि प्लेटफॉर्म को गैर-विशेष लाइसेंस मिलता है। SerpApi का कहना है कि यह अंतर "हर बिंदु के लिए घातक है" शिकायत का: आप कॉपीराइट के तहत उसकी रक्षा नहीं कर सकते, जिसका आप मालिक नहीं हैं। Google के खिलाफ वही तर्क बिल्कुल काम नहीं किया - वहां विवाद अपने स्वयं के परिणामों के बारे में था।
दूसरा - विशिष्ट उदाहरणों की सुरक्षा क्षमता। विस्तारित शिकायत में Reddit ने उस सामग्री के नमूने पेश किए, जिसे वह अपने कॉपीराइट के तहत मानता है: गोपनीयता नीति का एक अंश, फिल्मों की सूची, जाज क्लब की तारीख और पता। रक्षा तर्क करती है कि सूचियाँ, तथ्य और छोटे अंश सुरक्षा के स्तर तक नहीं पहुँचते। इसके अलावा एक अलग तर्क: SearchGuard "एक प्रभावी पहुंच नियंत्रण उपाय" नहीं है, क्योंकि कोई व्यक्ति इसे बिना किसी बाधा के पार कर सकता है - एक पहुंच मार्ग हमेशा खुला रहता है।
ये तर्क कहीं नहीं गए - वे केवल विषय पर सुनवाई के चरण तक स्थगित कर दिए गए हैं। इसलिए "Reddit ने जीत हासिल की" - एक मजबूत सरलीकरण है। सही कहना होगा: स्क्रैपर्स और डेटा खरीदारों के खिलाफ एंटी-सर्कम्वेंशन सिद्धांत को न्यूयॉर्क न्यायालय में जीने का अधिकार मिला है. अमेरिका में एक जिले का निर्णय दूसरे को बाध्य नहीं करता, और हम वास्तविक समय में प्रथाओं में विभाजन देख रहे हैं।
व्यावहारिक रूप से इसका क्या मतलब है
यदि आप व्यवसाय के लिए डेटा इकट्ठा कर रहे हैं, तो 31 जुलाई के निर्णय से कुछ बहुत ही व्यावहारिक बातें निकलती हैं।
- बाधा नहीं, बल्कि उसके पीछे की सामग्री का मूल्यांकन करें। मूल्य निर्धारण, कार्यक्रम या पते के पृष्ठ पर कैप्चा को दरकिनार करना - यह जोखिम की एक कहानी है। उसी बाधा को दरकिनार करना, जिसके लिए टेक्स्ट, तस्वीरें और समीक्षाएँ हैं, जिनके अधिकार किसी के पास हैं - यह मौलिक रूप से अलग है। कानूनी जोखिम वस्तु द्वारा निर्धारित किया जाता है, न कि उपकरण द्वारा।
- डेटा खरीदार अब सुरक्षित नहीं है। Perplexity ने अपनी सुरक्षा इस पर बनाई कि वह केवल अंतिम खरीदार है और "सार्वजनिक चर्चाओं का सारांश देती है"। न्यायालय ने इस तर्क को मामले को बंद करने के लिए पर्याप्त नहीं माना। यह सभी को एक सीधा संकेत है जो तैयार डेटासेट खरीदते हैं: डेटा की उत्पत्ति को समझाना होगा।
- अनुबंध और ToS DMCA से अलग रहते हैं। यहां तक कि जहां कॉपीराइट सिद्धांत टूट जाता है, उपयोग की शर्तों का उल्लंघन एक स्वतंत्र आधार के रूप में रहता है। DMCA पर प्लेटफॉर्म की हार का मतलब यह नहीं है कि स्क्रैपिंग "न्यायालय द्वारा अनुमोदित" है।
- संरचनात्मक स्तर वादियों के लिए स्पष्ट हो गया है। जब प्रॉक्सी प्रदाता प्रतिवादियों की सूची में आते हैं, तो "मेरे प्रदाता को मेरे ट्रैफ़िक के बारे में क्या पता है और वह क्या लॉग करता है" का प्रश्न पेरानॉयड नहीं रह जाता। एक प्रदाता चुनें जिसके पास पूल के स्रोत स्पष्ट हों, एक स्पष्ट स्वीकार्य उपयोग नीति हो और KYC हो - यह वही उबाऊ कागजी हिस्सा है जो संरचनात्मक भागीदार को किसी अन्य योजना के प्रतिभागी से अलग करता है। मानदंडों के बारे में हमने प्रॉक्सी के माध्यम से डेटा संग्रह के कानूनी प्रथाओं के विश्लेषण में लिखा है।
- जोखिम के स्तर के अनुसार कार्यों को विभाजित करें। मूल्य निगरानी, परिणामों की जांच, अपने संसाधनों की उपलब्धता की निगरानी और भू-टेस्टिंग - पूर्वानुमानित कानूनी प्रोफ़ाइल के साथ मानक परिदृश्य; इसके लिए निवासी प्रॉक्सी या सस्ते डेटा सेंटर पते उपयुक्त हैं, यदि प्लेटफॉर्म "निवासी" उत्पत्ति की आवश्यकता नहीं करता है। बड़े पैमाने पर किसी अन्य के कॉपीराइट सामग्री को मॉडल को प्रशिक्षित करने के लिए निकालना - एक परिदृश्य है जो अब न्यायालयों में जा रहा है, और इसे IP की रोटेशन के बजाय लाइसेंस के साथ हल करना चाहिए।
संक्षेप में
दो संघीय न्यायालयों ने ग्यारह दिनों में एक ही बाधा के एक ही दरकिनार करने के मूल्यांकन में भिन्नता दिखाई। कैलिफोर्निया: कॉपीराइट के बिना खोज सुरक्षा को दरकिनार करना - DMCA का उल्लंघन नहीं है। न्यूयॉर्क: यदि बाधा के पीछे संरक्षित उपयोगकर्ता सामग्री है, तो एंटी-सर्कम्वेंशन का आरोप सुनवाई के लिए योग्य है, और इसके साथ ही मध्यस्थों और डेटा खरीदारों के खिलाफ आरोप भी।
जो लोग पेशेवर रूप से डेटा के साथ काम करते हैं, उनके लिए एक निष्कर्ष है: डेटा संग्रह की तकनीकी पक्ष अब जोखिम का मुख्य कारक नहीं है। मुख्य प्रश्न यह है कि आप जो ले रहे हैं, उसके अधिकार क्या हैं, और उस श्रृंखला की पारदर्शिता, जिसके माध्यम से ये डेटा आपके पास आए हैं। मामले में अगली मील का पत्थर Oxylabs का आवेदन है, जिसे न्यायालय ने सह-प्रतिवादियों के निर्णय के बाद फिर से सक्रिय किया है।
```