Back to Blog

न्यायालय ने Reddit का Perplexity के खिलाफ मुकदमा खारिज किया: 11 दिनों में दो स्क्रैपिंग निर्णय

31 जुलाई 2026 को न्यायाधीश एंगेलमायर (SDNY) ने Reddit के खिलाफ Perplexity AI और SerpApi के खिलाफ मुकदमा बंद करने से इनकार कर दिया: DMCA के तहत एंटी-सर्कमवेंशन दावे कायम रहे। 11 दिन पहले कैलिफोर्निया की अदालत ने Google के खिलाफ लगभग समान मुकदमा उसी प्रतिवादी के खिलाफ खारिज कर दिया। एक ही सर्कमवेंशन को विपरीत आकलन क्यों मिला, ओक्सीलैब्स और AWMProxy प्रॉक्सी प्रदाताओं का क्या संबंध है और इससे क्या निष्कर्ष निकलता है।

📅August 3, 2026
न्यायालय ने Reddit का Perplexity के खिलाफ मुकदमा खारिज किया: 11 दिनों में दो स्क्रैपिंग निर्णय
```html

31 जुलाई 2026 को संघीय न्यायाधीश पोल एंगेलमेयर (न्यूयॉर्क के दक्षिणी जिले) ने Reddit के खिलाफ Perplexity AI और खोज परिणामों के एग्रीगेटर SerpApi के खिलाफ मुकदमा बंद करने से इनकार कर दिया। DMCA § 1201(a) के तहत एंटी-सर्कम्वेंशन के प्रमुख आरोपों ने खड़े रहने का काम किया - मामला आगे बढ़ रहा है। इससे ग्यारह दिन पहले, उत्तरी कैलिफोर्निया में एक अन्य संघीय न्यायाधीश ने उसी SerpApi के खिलाफ Google का लगभग समान मुकदमा खारिज कर दिया। एक ही तकनीकी बाधा, एक ही प्रतिवादी - और दो विपरीत परिणाम।

यह न्यायालयों के बीच विरोधाभास नहीं है। यह स्पष्ट संकेत है कि 2026 में स्क्रैपिंग में कानूनी सीमा वास्तव में कहां है। और यह वहां नहीं है जहां इंजीनियरों ने इसे खोजने की आदत डाली है।

31 जुलाई को न्यायालय ने क्या निर्णय लिया

मामला Reddit, Inc. v. SerpApi LLC et al. (संख्या 1:25-cv-08736) Reddit ने 22 अक्टूबर 2025 को दायर किया, और फरवरी 2026 में शिकायत का विस्तार किया। प्रतिवादियों की संख्या चार है, और उनका संयोजन महत्वपूर्ण है: AI कंपनी Perplexity AI, एग्रीगेटर SerpApi और दो प्रॉक्सी प्रदाता - Oxylabs UAB और AWMProxy

आरोप की तर्कशक्ति यह है: मध्यस्थों ने औद्योगिक पैमाने पर Reddit की सामग्री को Reddit के सर्वरों से नहीं, बल्कि Google के खोज परिणामों से निकाला, अपने स्रोत को छिपाते हुए, ताकि सुरक्षा को दरकिनार किया जा सके; Perplexity ने इन डेटा को खरीदा और अपने AI इंजन में प्रस्तुत किया।

जज एंगेलमेयर ने आरोपों को विभाजित किया:

  • खड़े रहे: DMCA § 1201(a) के तहत मुख्य आरोप - तकनीकी पहुंच नियंत्रण उपाय को दरकिनार करना। न्यायालय ने माना कि Google SearchGuard सुरक्षा तंत्र कानून के अर्थ में एक पहुंच नियंत्रण उपाय के रूप में योग्य है, और Reddit "DMCA के एंटी-सर्कम्वेंशन नियमों के हितों के क्षेत्र में" है। न्यायाधीश के शब्दों में, मंच "संरक्षित कार्यों के वैश्विक डिजिटल बाजार का प्रतिनिधित्व करता है," जिसके विकास के लिए DMCA को अपनाया गया था।
  • खारिज किया गया: SerpApi के खिलाफ § 1201(b) के तहत "ट्रैफिकिंग" का आरोप, साथ ही दोनों प्रतिवादियों के खिलाफ अनुचित प्रतिस्पर्धा और बिना कारण समृद्धि के आरोप।

महत्वपूर्ण नोट: यह एक मुकदमे को खारिज करने के आवेदन पर निर्णय है, न कि मामले के विषय पर एक निर्णय। न्यायालय ने केवल कहा कि मामला सुनवाई तक जीवित रहने का अधिकार रखता है। लेकिन इस चरण पर आमतौर पर कमजोर मुकदमे स्क्रैपर्स के खिलाफ मर जाते हैं - यह नहीं मरा।

Google क्यों हारा, जबकि Reddit ने फ़िल्टर पास किया

20 जुलाई 2026 को उत्तरी कैलिफोर्निया में अध्यक्षता करने वाली न्यायाधीश इवोन गोंजालेज रोजर्स ने DMCA के तहत SerpApi के खिलाफ Google का मुकदमा खारिज कर दिया - बिना पूर्व रूप में पुनः प्रस्तुत करने के अधिकार के। हमने इस निर्णय का विस्तार से विश्लेषण किया: न्यायालय ने सहमति व्यक्त की कि ब्राउज़र फिंगरप्रिंट्स का प्रतिस्थापन, IP की रोटेशन और कैप्चा का समाधान - तकनीकी रूप से दरकिनार करना है, लेकिन दरकिनार करना अपने आप में अवैध नहीं है, यदि बाधा के पीछे कोई कॉपीराइट से संरक्षित कार्य नहीं है।

Google इसी पर ठोकर खा गया। कंपनी ने यह नहीं कहा कि उसके खोज परिणाम कॉपीराइट कानून द्वारा संरक्षित हैं, और यह नहीं दिखाया कि उसने SearchGuard को "अधिकार धारक की अनुमति से" लागू किया है, जैसा कि 17 U.S.C. § 1201(a)(3)(B) की आवश्यकता है। बाधा विज्ञापन राजस्व की रक्षा कर रही थी - और DMCA राजस्व की नहीं, बल्कि कॉपीराइट की रक्षा करता है।

Reddit ने दूसरी तरफ से प्रवेश किया। उसी SearchGuard के पीछे, Reddit के अनुसार, "सपाट अप्रासंगिक परिणाम" नहीं हैं, बल्कि उपयोगकर्ता के पोस्ट हैं - जीवित लोगों के टेक्स्ट, जिनके अधिकार Reddit लाइसेंस करता है, जिसमें Google और OpenAI के साथ वित्तीय लेनदेन शामिल हैं। अंतर तकनीक में नहीं है। अंतर यह है कि क्या वास्तव में बाधा के पीछे है।

एक निष्कर्ष जो इंजीनियरों और डेटा मालिकों को ध्यान में रखना चाहिए: क्रियाओं की तकनीकी पहचान कानूनी परिणामों की पहचान का अर्थ नहीं रखती। एक ही स्क्रिप्ट के साथ निवासी IP की रोटेशन एक मामले में - सार्वजनिक तथ्यों के साथ कानूनी काम, दूसरे में - संरक्षित कार्य की सुरक्षा को दरकिनार करना।

इस मामले में प्रॉक्सी कहां है

हमारे क्षेत्र के लिए इस मामले में सबसे दिलचस्प बात Perplexity नहीं है, बल्कि प्रतिवादियों की सूची में दो अन्य नाम हैं। Oxylabs और AWMProxy गवाहों के रूप में नहीं, और न ही "तीसरे पक्ष के उपकरण" के रूप में, बल्कि सह-प्रतिवादी के रूप में शामिल किए गए हैं: वादी का मानना है कि अज्ञातता का बुनियादी ढांचा दरकिनार करने की योजना का हिस्सा था।

Oxylabs का मुकदमा खारिज करने का आवेदन न्यायालय ने रोक दिया - क्योंकि इसके तर्कों का SerpApi और Perplexity के तर्कों के साथ महत्वपूर्ण ओवरलैप था, ब्रीफिंग को सह-प्रतिवादियों के आवेदन के समाधान तक स्थगित कर दिया गया। ये आवेदन अब हल हो गए हैं, और मूल एंटी-सर्कम्वेंशन सिद्धांत जीवित है। इसका मतलब है कि प्रॉक्सी प्रदाता की बारी आ गई है, और वह छह महीने पहले की तुलना में स्पष्ट रूप से खराब बातचीत की स्थिति में है।

मामले के दस्तावेजों से दो और विवरण, जो पैमाने और प्रमाणन के तरीकों के बारे में बहुत कुछ कहते हैं:

  • न्यायालय के अनुरोध पर प्राप्त आंकड़ों के अनुसार, SerpApi ने जुलाई 2025 के दो सप्ताह में लगभग 1.8 बिलियन Google खोज परिणाम पृष्ठों तक पहुंच बनाई, जिनमें Reddit के डेटा शामिल थे।
  • Reddit ने एक क्लासिक ट्रैप का उपयोग किया: सामग्री को केवल Google क्रॉलर के लिए दृश्य बनाया, और फिर उसे Perplexity के उत्तरों में पाया। यह वही प्रकार का प्रमाण है जो "वे कहीं से डेटा ले रहे हैं" के अमूर्त को विशिष्ट आपूर्ति श्रृंखला में बदल देता है।

"जहरीले प्रलोभन" की तकनीक को एक और कारण से याद रखना चाहिए। यह दिखाता है कि बड़े प्लेटफार्मों ने लंबे समय से ब्लॉक से सबूत इकट्ठा करने की ओर बढ़ना शुरू कर दिया है: चिह्नित सामग्री, हनीपॉट पृष्ठ, अद्वितीय स्निपेट। यदि आपकी सावधानी नेटवर्क स्तर पर है, तो यह मदद नहीं करती, यदि सामग्री स्वयं चिह्नित है।

मुकदमे की कमजोरियां, जिनके बारे में शायद ही कभी लिखा जाता है

Reddit ने पहले फ़िल्टर को पास किया, लेकिन उसकी स्थिति बिल्कुल भी निर्दोष नहीं है, और रक्षा दो संवेदनशील बिंदुओं पर हमला कर रही है।

पहला - पोस्टों का मालिक कौन है। Reddit की उपयोगकर्ता नीति प्रकाशनों के अधिकार लेखकों के पास रखती है, जबकि प्लेटफॉर्म को गैर-विशेष लाइसेंस मिलता है। SerpApi का कहना है कि यह अंतर "हर बिंदु के लिए घातक है" शिकायत का: आप कॉपीराइट के तहत उसकी रक्षा नहीं कर सकते, जिसका आप मालिक नहीं हैं। Google के खिलाफ वही तर्क बिल्कुल काम नहीं किया - वहां विवाद अपने स्वयं के परिणामों के बारे में था।

दूसरा - विशिष्ट उदाहरणों की सुरक्षा क्षमता। विस्तारित शिकायत में Reddit ने उस सामग्री के नमूने पेश किए, जिसे वह अपने कॉपीराइट के तहत मानता है: गोपनीयता नीति का एक अंश, फिल्मों की सूची, जाज क्लब की तारीख और पता। रक्षा तर्क करती है कि सूचियाँ, तथ्य और छोटे अंश सुरक्षा के स्तर तक नहीं पहुँचते। इसके अलावा एक अलग तर्क: SearchGuard "एक प्रभावी पहुंच नियंत्रण उपाय" नहीं है, क्योंकि कोई व्यक्ति इसे बिना किसी बाधा के पार कर सकता है - एक पहुंच मार्ग हमेशा खुला रहता है।

ये तर्क कहीं नहीं गए - वे केवल विषय पर सुनवाई के चरण तक स्थगित कर दिए गए हैं। इसलिए "Reddit ने जीत हासिल की" - एक मजबूत सरलीकरण है। सही कहना होगा: स्क्रैपर्स और डेटा खरीदारों के खिलाफ एंटी-सर्कम्वेंशन सिद्धांत को न्यूयॉर्क न्यायालय में जीने का अधिकार मिला है. अमेरिका में एक जिले का निर्णय दूसरे को बाध्य नहीं करता, और हम वास्तविक समय में प्रथाओं में विभाजन देख रहे हैं।

व्यावहारिक रूप से इसका क्या मतलब है

यदि आप व्यवसाय के लिए डेटा इकट्ठा कर रहे हैं, तो 31 जुलाई के निर्णय से कुछ बहुत ही व्यावहारिक बातें निकलती हैं।

  1. बाधा नहीं, बल्कि उसके पीछे की सामग्री का मूल्यांकन करें। मूल्य निर्धारण, कार्यक्रम या पते के पृष्ठ पर कैप्चा को दरकिनार करना - यह जोखिम की एक कहानी है। उसी बाधा को दरकिनार करना, जिसके लिए टेक्स्ट, तस्वीरें और समीक्षाएँ हैं, जिनके अधिकार किसी के पास हैं - यह मौलिक रूप से अलग है। कानूनी जोखिम वस्तु द्वारा निर्धारित किया जाता है, न कि उपकरण द्वारा।
  2. डेटा खरीदार अब सुरक्षित नहीं है। Perplexity ने अपनी सुरक्षा इस पर बनाई कि वह केवल अंतिम खरीदार है और "सार्वजनिक चर्चाओं का सारांश देती है"। न्यायालय ने इस तर्क को मामले को बंद करने के लिए पर्याप्त नहीं माना। यह सभी को एक सीधा संकेत है जो तैयार डेटासेट खरीदते हैं: डेटा की उत्पत्ति को समझाना होगा।
  3. अनुबंध और ToS DMCA से अलग रहते हैं। यहां तक कि जहां कॉपीराइट सिद्धांत टूट जाता है, उपयोग की शर्तों का उल्लंघन एक स्वतंत्र आधार के रूप में रहता है। DMCA पर प्लेटफॉर्म की हार का मतलब यह नहीं है कि स्क्रैपिंग "न्यायालय द्वारा अनुमोदित" है।
  4. संरचनात्मक स्तर वादियों के लिए स्पष्ट हो गया है। जब प्रॉक्सी प्रदाता प्रतिवादियों की सूची में आते हैं, तो "मेरे प्रदाता को मेरे ट्रैफ़िक के बारे में क्या पता है और वह क्या लॉग करता है" का प्रश्न पेरानॉयड नहीं रह जाता। एक प्रदाता चुनें जिसके पास पूल के स्रोत स्पष्ट हों, एक स्पष्ट स्वीकार्य उपयोग नीति हो और KYC हो - यह वही उबाऊ कागजी हिस्सा है जो संरचनात्मक भागीदार को किसी अन्य योजना के प्रतिभागी से अलग करता है। मानदंडों के बारे में हमने प्रॉक्सी के माध्यम से डेटा संग्रह के कानूनी प्रथाओं के विश्लेषण में लिखा है।
  5. जोखिम के स्तर के अनुसार कार्यों को विभाजित करें। मूल्य निगरानी, परिणामों की जांच, अपने संसाधनों की उपलब्धता की निगरानी और भू-टेस्टिंग - पूर्वानुमानित कानूनी प्रोफ़ाइल के साथ मानक परिदृश्य; इसके लिए निवासी प्रॉक्सी या सस्ते डेटा सेंटर पते उपयुक्त हैं, यदि प्लेटफॉर्म "निवासी" उत्पत्ति की आवश्यकता नहीं करता है। बड़े पैमाने पर किसी अन्य के कॉपीराइट सामग्री को मॉडल को प्रशिक्षित करने के लिए निकालना - एक परिदृश्य है जो अब न्यायालयों में जा रहा है, और इसे IP की रोटेशन के बजाय लाइसेंस के साथ हल करना चाहिए।

संक्षेप में

दो संघीय न्यायालयों ने ग्यारह दिनों में एक ही बाधा के एक ही दरकिनार करने के मूल्यांकन में भिन्नता दिखाई। कैलिफोर्निया: कॉपीराइट के बिना खोज सुरक्षा को दरकिनार करना - DMCA का उल्लंघन नहीं है। न्यूयॉर्क: यदि बाधा के पीछे संरक्षित उपयोगकर्ता सामग्री है, तो एंटी-सर्कम्वेंशन का आरोप सुनवाई के लिए योग्य है, और इसके साथ ही मध्यस्थों और डेटा खरीदारों के खिलाफ आरोप भी।

जो लोग पेशेवर रूप से डेटा के साथ काम करते हैं, उनके लिए एक निष्कर्ष है: डेटा संग्रह की तकनीकी पक्ष अब जोखिम का मुख्य कारक नहीं है। मुख्य प्रश्न यह है कि आप जो ले रहे हैं, उसके अधिकार क्या हैं, और उस श्रृंखला की पारदर्शिता, जिसके माध्यम से ये डेटा आपके पास आए हैं। मामले में अगली मील का पत्थर Oxylabs का आवेदन है, जिसे न्यायालय ने सह-प्रतिवादियों के निर्णय के बाद फिर से सक्रिय किया है।

```