8 जुलाई 2026 को ब्रुसेल्स में डेटा प्रोटेक्शन के लिए यूरोपीय परिषद (EDPB) ने "जनरेटिव AI के संदर्भ में वेब स्क्रैपिंग पर मार्गदर्शिका 03/2026" को अपनाया - यह पहला यूरोपीय दस्तावेज है जो सीधे उस प्रश्न का उत्तर देता है जो वर्षों से डेटा संग्रह उद्योग पर लटका हुआ है: क्या स्क्रैपिंग GDPR के अंतर्गत आती है, यदि डेटा सार्वजनिक रूप से उपलब्ध है? EDPB का उत्तर स्पष्ट है और कई लोगों के लिए अप्रिय है: हाँ, यह शामिल है - और "सार्वजनिक" अब "स्वतंत्र रूप से लिया जा सकता है" का अर्थ नहीं है. यह दस्तावेज़ 30 अक्टूबर 2026 तक सार्वजनिक परामर्श के लिए खुला है, लेकिन पहले से ही यह एक ढांचा निर्धारित करता है जिसके अनुसार यूरोपीय नियामक किसी भी व्यक्तिगत डेटा के संग्रह का मूल्यांकन करेंगे.
EDPB ने क्या निर्णय लिया
मार्गदर्शिका का मुख्य तर्क सरल है. GDPR तब लागू होता है जब वेब स्क्रैपिंग व्यक्तिगत डेटा को प्रभावित करता है - अर्थात् सूचना के संग्रह, भंडारण, संगठन और निष्कर्षण के किसी भी संचालन पर, जिसके माध्यम से किसी व्यक्ति की पहचान सीधे या अप्रत्यक्ष रूप से की जा सकती है. और - एक महत्वपूर्ण बिंदु - यह मायने नहीं रखता कि यह जानकारी सार्वजनिक रूप से दिखाई दे रही है या नहीं. EDPB स्पष्ट रूप से उद्योग में लोकप्रिय धारणा को खारिज करता है कि "चूंकि डेटा एक सार्वजनिक प्रोफ़ाइल में है, इसलिए यह नियमन से बाहर है". संगठनों को यह उम्मीद नहीं करनी चाहिए कि यूरोपीय प्राधिकरण ऐसे डेटा को GDPR से बाहर मानेंगे.
यह सामान्य तर्क को पलट देता है. वर्षों से डेटा संग्रहकर्ता "सार्वजनिक रूप से उपलब्ध + निवासी प्रॉक्सी = तकनीकी रूप से संभव, कानूनी रूप से सहनीय" के संयोजन पर निर्भर थे. EDPB दो प्रश्नों को अलग करता है, जो पहले एक में मिलते थे: डेटा की तकनीकी उपलब्धता और उनके प्रसंस्करण के लिए कानूनी आधार - यह एक ही चीज़ नहीं है. पहला बुनियादी ढांचे द्वारा हल किया जाता है. दूसरा - केवल कानून द्वारा.
"कानूनी हित" का परीक्षण: अब डिफ़ॉल्ट रूप से नहीं
अधिकांश व्यक्तिगत डेटा स्क्रैपर्स अपने प्रसंस्करण को "कानूनी हित" (legitimate interest, अनुच्छेद 6(1)(f) GDPR) के आधार पर सही ठहराते हैं. EDPB पुष्टि करता है कि यह आधार मूल रूप से AI को प्रशिक्षित करने के लिए स्क्रैपिंग पर लागू होता है, लेकिन इसे कठोर शर्तों के साथ जोड़ता है. कोई "थोक" मूल्यांकन नहीं हो सकता - परीक्षण प्रत्येक विशिष्ट मामले के लिए किया जाता है और इसमें तीन चरण होते हैं:
- वास्तविक हित. एक विशिष्ट, कानूनी और प्रासंगिक हित को स्पष्ट रूप से परिभाषित करना - "हमें डेटा की आवश्यकता है" का अमूर्त रूप नहीं.
- आवश्यकता. यह साबित करना कि लक्ष्य को कम हस्तक्षेपकारी तरीके से प्राप्त नहीं किया जा सकता है, जैसे कि व्यक्तिगत डेटा का सामूहिक संग्रह.
- संतुलन. अपने हित को उन मूल अधिकारों और लोगों की उचित अपेक्षाओं के खिलाफ तौलना, जिनके डेटा एकत्र किए जा रहे हैं - और यह दिखाना कि यह उन्हें नहीं बढ़ाता.
इसके अलावा, दस्तावेज़ को पूर्व में होना चाहिए, न कि बाद में उत्पन्न होना चाहिए. जैसा कि ब्रायन हेंगेसबो, बेकर मैकेंजी में डेटा और साइबर प्रैक्टिस के वैश्विक प्रमुख ने उल्लेख किया है, जब शिकायत की जांच की जाती है, तो नियामक सबसे पहले कानूनी हित का मूल्यांकन और पुष्टि करने वाली दस्तावेज़ीकरण की मांग करेगा. यदि कागज नहीं है - तो सुरक्षा नहीं है.
डेटा का न्यूनतमकरण: संग्रह से पहले फ़िल्टर करना, बाद में नहीं
EDPB पहले अनुरोध से पहले डिज़ाइन के चरण में सुरक्षा को शामिल करने की मांग करता है. नियंत्रक को:
- संग्रह के लिए सटीक मानदंड निर्धारित करना, न कि सब कुछ इकट्ठा करना;
- संवेदनशील डेटा श्रेणियों को बाहर करने वाले फ़िल्टर लागू करना;
- कुछ साइटों को बाहर करना - विशेष रूप से उन संसाधनों को जो नाबालिगों पर केंद्रित हैं, और साइटें जहां स्क्रैपिंग से सुरक्षा है;
- संग्रह के बाद पोस्ट-प्रोसेसिंग लागू करना: वाक्यात्मक फ़िल्टरिंग और अज्ञातकरण.
"स्क्रैपिंग से सुरक्षा वाली साइटों" का बिंदु दो बार पढ़ने लायक है. EDPB वास्तव में कहता है: यदि संसाधन ने स्पष्ट रूप से एंटी-बॉट बाधाएँ स्थापित की हैं, तो उन्हें बायपास करना - यह संकेत है कि आप मालिक की इच्छा और उपयोगकर्ताओं की उचित अपेक्षाओं के खिलाफ कार्य कर रहे हैं. यह CFAA या हैकिंग के बारे में नहीं है, यह GDPR के भीतर हितों के संतुलन के बारे में है.
विशेष डेटा श्रेणियाँ - लगभग वर्जित
स्वास्थ्य, राजनीतिक विचारों, धर्म, यौन अभिविन्यास (अनुच्छेद 9 GDPR) के बारे में डेटा को स्क्रैपिंग में मूल रूप से संग्रह के लिए प्रतिबंधित किया गया है - और यहां तक कि अनजाने में उनका अधिग्रहण (जैसे, किसी सामाजिक नेटवर्क में एक सार्वजनिक पोस्ट से) एक सख्त प्रतिबंध को सक्रिय करता है. कानूनी प्रसंस्करण के लिए अनुच्छेद 6 के आधार और अनुच्छेद 9(2) के अपवाद दोनों की आवश्यकता होती है, जो आमतौर पर एक सामूहिक स्क्रैपर के पास नहीं होते. EDPB जीवन चक्र के सभी चरणों पर नियंत्रण की मांग करता है - यहां तक कि मॉडल के आउटपुट पर फ़िल्टर और तैनाती के बाद प्रॉम्प्ट पर प्रतिबंध.
यह दस्तावेज़ अब क्यों आया
अब तक, यूरोप AI के लिए स्क्रैपिंग पर बिखरे हुए तरीके से प्रतिक्रिया कर रहा था, राष्ट्रीय प्राधिकरणों द्वारा - और परिणाम विरोधाभासी थे. इटालियन गारंटे ने दिसंबर 2024 में OpenAI पर 15 मिलियन यूरो का जुर्माना लगाया था क्योंकि ChatGPT को उचित कानूनी आधार के बिना और पारदर्शिता की आवश्यकताओं का उल्लंघन करते हुए प्रशिक्षित किया गया था. लेकिन मार्च 2026 में रोम की अदालत ने इस दंड को रद्द कर दिया - यह स्पष्ट रूप से दर्शाता है कि कानूनी आधार कितना अस्थिर था. आयरिश DPC ने 2024 में उच्च न्यायालय में याचिका दायर करके X को सदा के लिए रोकने में सफल रहा कि वह 7 मई से 1 अगस्त 2024 तक यूरोपीय उपयोगकर्ताओं के सार्वजनिक पोस्ट पर Grok चैटबॉट को प्रशिक्षित करे. इसके अलावा, डच और फ्रांसीसी नियामकों की अलग-अलग कार्रवाइयाँ.
इस प्रकार का पैचवर्क परिदृश्य कंपनियों और नागरिकों के लिए अनिश्चितता पैदा करता था. मार्गदर्शिका 03/2026 पहले के "मत 28/2024" को AI पर विकसित करती है और पहली बार सभी 27 देशों के लिए एक समान मानक निर्धारित करती है. उसी दिन EDPB ने अज्ञातकरण पर एक समवर्ती मार्गदर्शिका को भी अपनाया, जिसमें तीन शर्तों का मानदंड स्थापित किया: डेटा को तभी अज्ञात माना जाता है जब इसे न तो किसी विशेष रिकॉर्ड से अलग किया जा सके, न ही रिकॉर्ड को एक-दूसरे से जोड़ा जा सके, और न ही किसी व्यक्ति के बारे में नई जानकारी निकाली जा सके. जैसा कि EDPB की अध्यक्ष अन्नु तालुस ने कहा, दस्तावेज़ "स्पष्ट मानक स्थापित करते हैं, जो डेटा के उपयोग को आसान बनाते हैं, जबकि लोगों के मूल अधिकारों की रक्षा करते हैं".
यह डेटा संग्रहकर्ताओं के लिए क्या अर्थ रखता है
पहला और सबसे महत्वपूर्ण: GDPR के क्षेत्रीय कवरेज के बारे में है. यदि आपके नमूने में EU निवासियों के व्यक्तिगत डेटा हैं - तो यह विनियमन लागू होता है, चाहे आप स्वयं कहाँ हों. और यह केवल LLM प्रयोगशालाओं तक सीमित नहीं है: यह किसी भी संगठन पर लागू होता है जो सीधे या ठेकेदारों के माध्यम से डेटा स्क्रैप करता है - चाहे वह मॉडल को फिर से प्रशिक्षित करने के लिए हो या भावनात्मक विश्लेषण के लिए.
दूसरा - व्यावहारिक विभाजन डेटा के प्रकार के अनुसार होता है, न कि पहुंच के तरीके के अनुसार:
- गैर-व्यक्तिगत डेटा - मूल्य, उत्पाद की उपलब्धता, विशेषताएँ, व्यक्तित्व से बिना जुड़े सार्वजनिक पाठ, बाजार विश्लेषण - अब भी कम जोखिम वाले क्षेत्र में हैं. मूल्य निगरानी, कैटलॉग का पार्सिंग, GDPR के तहत व्यक्तिगत डेटा के लिए SERP संरचना का संग्रह नहीं करता है.
- व्यक्तिगत डेटा - प्रोफाइल, संपर्क, विशिष्ट व्यक्तियों का व्यवहार - अब पूर्ण GDPR के अंतर्गत हैं, भले ही वे सार्वजनिक रूप से उपलब्ध हों. यहां कानूनी आधार, कानूनी हित का दस्तावेज़ीकृत परीक्षण, न्यूनतमकरण और प्रारंभिक अज्ञातकरण की आवश्यकता होती है.
तीसरा - डेटा संग्रह की स्वच्छता, जिसे EDPB ने वास्तव में अनिवार्य बना दिया है: संकीर्ण चयन मानदंड, व्यक्तिगत और संवेदनशील डेटा की फ़िल्टरिंग, जितना संभव हो सके पहले अज्ञातकरण, एंटी-स्क्रैपिंग बाधाओं और नाबालिगों के लिए साइटों का सम्मान, स्क्रैपिंग का विवरण देने वाली सार्वजनिक गोपनीयता नीति.
यहां प्रॉक्सी कहाँ हैं - और कहाँ नहीं हैं
ईमानदारी से दो स्तरों को अलग करना महत्वपूर्ण है, जिन्हें EDPB ने पहले अलग किया. बुनियादी ढांचे का चयन - निवासी, मोबाइल या डेटा सेंटर प्रॉक्सी - विश्वसनीयता, भू-स्थान और सफल अनुरोधों का प्रतिशत निर्धारित करता है, यानी संग्रह की तकनीकी पक्ष. लेकिन यह आपके कानूनी आधार को नहीं बदलता. निवासी IP अवैध व्यक्तिगत डेटा प्रसंस्करण को कानूनी में नहीं बदलता - अनुपालन इस बात में है कि आप क्या इकट्ठा करते हैं और क्यों, न कि किस पते से अनुरोध भेजा जाता है. यह, वैसे, ईमानदार परियोजनाओं के लिए एक अच्छी खबर है: यदि आप गैर-व्यक्तिगत डेटा को पार्स करते हैं या व्यक्तिगत डेटा को सही ढंग से फ़िल्टर और अज्ञात करते हैं, तो गुणवत्ता वाली प्रॉक्सी बुनियादी ढांचे तकनीकी कार्य को हल करती है, और आप कानूनी क्षेत्र में रहते हैं.
यही तर्क एजेंट स्क्रैपिंग पर भी लागू होता है, जहां AI एजेंट स्वयं पार्सर्स लिखते हैं: उपकरण अधिक स्मार्ट हो गया है, लेकिन डेटा प्रसंस्करण के नियम इससे नरम नहीं हुए हैं - इसके विपरीत, EDPB इन आवश्यकताओं को ऐसे पाइपलाइनों पर भी लागू करता है.
निष्कर्ष
मार्गदर्शिका 03/2026 वेब स्क्रैपिंग को प्रतिबंधित नहीं करती है - यह इस सुखद भ्रांति को समाप्त करती है कि डेटा की खुलापन उनके प्रसंस्करण के प्रश्न को हटा देता है. EU में "सार्वजनिक का अर्थ मुफ्त" का युग व्यक्तिगत डेटा के लिए 8 जुलाई 2026 को समाप्त हो गया. डेटा संग्रहकर्ताओं के लिए यह कोई सजा नहीं है, बल्कि अनुशासन का परिवर्तन है: व्यक्तिगत और गैर-व्यक्तिगत को अलग करना, प्रवेश पर फ़िल्टर करना, जल्दी अज्ञात करना, कानूनी हित को दस्तावेज़ित करना पहले, न कि नियामक के अनुरोध के बाद. तकनीक अभी भी प्रॉक्सी और एंटी-डिटेक्ट द्वारा तय होती है; कानूनीता अब इस बात से तय होती है कि आप अपनी आधार में क्या डालते हैं.
```