Back to Blog

आपको बैन नहीं किया गया - आपको कचरा खिलाया गया: टारपिट्स और ज़हरीले पृष्ठ 2026 में

HTTP 200 अब "डेटा एकत्रित किया गया" का अर्थ नहीं है। Nepenthes, Iocaine और Cloudflare AI Labyrinth क्रॉलर को अंतहीन उत्पन्न पाठ से खिलाते हैं, जबकि विषाक्त पृष्ठ AI एजेंटों को 27–73.8% मामलों में अस्तित्वहीन ब्रांडों की सिफारिश करने के लिए मजबूर करते हैं। हम डेटा की चुपचाप खराब होने की तीन यांत्रिकाओं और सात जांचों का विश्लेषण करते हैं, जो डेटाबेस में रिकॉर्ड करने से पहले कचरे को पकड़ती हैं।

📅September 13, 2026
आपको बैन नहीं किया गया - आपको कचरा खिलाया गया: टारपिट्स और ज़हरीले पृष्ठ 2026 में

पार्सर काम कर रहा है। HTTP 200 लगातार प्रवाह में आ रहे हैं, प्रॉक्सी जीवित हैं, कैप्चा नहीं आ रहा है, लिंक की कतार बढ़ रही है। और एक सप्ताह बाद पता चलता है कि आधी एकत्रित कीमतें - काल्पनिक हैं, और गीगाबाइट्स ट्रैफिक उन पृष्ठों पर चला गया है, जो असली वेबसाइट पर मौजूद नहीं हैं। यह पार्सर की खराबी नहीं है और न ही खराब IP पूल है। यह सुरक्षा का नया मोड है: वेबसाइट आपको ब्लॉक नहीं करती, वेबसाइट आपको खिलाती है।

डेढ़ साल में एंटी-बॉट सुरक्षा उद्योग ने चुपचाप अपना लक्ष्य बदल लिया है। ब्लॉक करना - महंगा और ध्यान देने योग्य उपाय है: स्क्रैपर 403 देखता है, फिंगरप्रिंट को ठीक करता है, सबनेट बदलता है और वापस आता है। इससे कहीं अधिक लाभकारी है कि उसे काम करने से न रोका जाए, बल्कि उसकी मेहनत को बेकार बना दिया जाए। नीचे - तीन तंत्र हैं, जो पहले से ही लाखों वेबसाइटों पर काम कर रहे हैं, और चेक की एक श्रृंखला है, जो उन्हें आपकी ओर पकड़ती है।

पहला तंत्र: ब्लॉक के बजाय टारपिट

टारपिट (tarpit, "गर्म गंदगी") - यह अंतहीन वेबसाइट का जनरेटर है। क्रॉलर को एक मान्य HTML-पृष्ठ मिलता है जिसमें दर्जनों लिंक होते हैं, प्रत्येक लिंक एक समान जनरेटेड पृष्ठ पर जाता है, और क्रॉलिंग की कतार कभी खाली नहीं होती।

सबसे प्रसिद्ध ओपन टूल - Nepenthes है। इसकी सेटिंग्स अच्छी तरह से इरादे को दर्शाती हैं: डिफ़ॉल्ट रूप से सर्वर 10 से 65 सेकंड तक का उत्तर रखता है, "मार्कोव की बकवास" का पाठ देता है, जो कॉर्पस से जनरेट किया गया है, और यह निश्चित रूप से करता है - एक ही URL हमेशा एक ही कचरा लौटाता है, ताकि पृष्ठ सामान्य स्थैतिक फ़ाइलों की तरह दिखें, न कि जाल। डेटा छोटे हिस्सों में दिया जाता है, "कुछ बाइट्स में", ताकि ग्राहक के टाइमआउट को जलाया जा सके। लेखक एक घंटे के काम के लिए माप देता है: 1850 विभिन्न ग्राहकों, 10,015 अनुरोधों और 56,020 सेकंड की कुल देरी - लगभग पंद्रह घंटे की बेकार मशीन समय।

Iocaine का ढांचा अलग है: यह असली वेबसाइट के सामने एक रिवर्स प्रॉक्सी के रूप में काम करता है, पहले ही इंटरसेप्ट पर बॉट को एक अद्वितीय "जहरीला" लिंक देता है और उसी पर उसकी पहचान करता है, जबकि पाठ मार्कोव श्रृंखलाओं द्वारा जनरेट किया जाता है - इस उम्मीद में कि यह पाठ प्रशिक्षण सेट में जाएगा।

Cloudflare में वही तकनीक एक उत्पाद बन गई - AI Labyrinth, जो मार्च 2025 में प्रस्तुत की गई। प्रलोभन पृष्ठों को तुरंत जनरेट नहीं किया जाता: AI वर्कर्स पर प्री-जनरेशन का एक कन्वेयर उपयोग किया जाता है, परिणाम R2 में संग्रहीत होता है और तेजी से वितरित किया जाता है। लैबिरिंथ के लिंक सामान्य पृष्ठों में HTML ट्रांसफॉर्मेशन के माध्यम से डाले जाते हैं, और प्रलोभनों पर इंडेक्सिंग के खिलाफ मेटा-डायरेक्टिव होते हैं, ताकि परिणाम प्रभावित न हो। यहाँ मुख्य बात - बॉट का बर्बाद किया गया समय नहीं है, बल्कि संकेत है: nofollow के साथ मानव से छिपे लिंक पर केवल ऑटोमेटेड चलते हैं, और ऐसे लैबिरिंथ में तीन स्तरों की गहराई में जाना स्वयं एक खराब बॉट का फिंगरप्रिंट बन जाता है। इस समस्या का पैमाना, जिसके लिए यह किया गया था, Cloudflare 50 बिलियन से अधिक अनुरोधों का आंकलन करता है जो AI क्रॉलर से प्रतिदिन आते हैं - नेटवर्क के कुल ट्रैफिक का लगभग 1%

आपकी लॉग में टारपिट कैसे दिखता है

विशिष्ट चित्र: हजारों URL की कतार, जो केवल बढ़ती है, प्रतिक्रिया का समय स्थिर रूप से डेढ़ सेकंड और उससे ऊपर रहता है, HTTP कोड - लगातार 200, और निकाले गए उपयोगी रिकॉर्ड की संख्या शून्य है। न तो कोई 403, न कोई कैप्चा, और न ही कोई बाहर निकलने का रास्ता: कितने भी पृष्ठों को पार किया गया हो, नए लिंक पुराने लिंक के बंद होने से तेजी से प्रकट होते हैं।

दूसरा तंत्र: AI-एजेंटों के लिए जहर दिया गया सामग्री

यदि पहला तंत्र संसाधनों को जलाता है, तो दूसरा परिणाम पर प्रहार करता है। शोधकर्ताओं Minghao Luo और Liang Chen ने जून 2026 में FORGE (Fake Online Recommendations in Generative Environments) के साथ एक कार्य प्रकाशित किया: उन्होंने 12 बड़े भाषा मॉडल का परीक्षण 225 उत्पादों में 15 श्रेणियों पर किया - कपड़ों से लेकर इलेक्ट्रॉनिक्स तक। हमले का तंत्र सरल है: पृष्ठ के पाठ में असली ब्रांड को काल्पनिक से बदल दिया जाता है।

परिणाम - एक नकली पृष्ठ 27% मामलों में देता है, जब सहायक एक गैर-मौजूद ब्रांड की सिफारिश करता है, और तीन शीर्ष परिणामों के सभी को बदलने से यह हिस्सा 73.8% तक बढ़ जाता है। मॉडल केवल झूठे नाम को दोहराते नहीं थे - वे इसके लिए गुण भी गढ़ते थे, जिसमें कथित रूप से समुदायों में लोकप्रियता शामिल थी। तीन प्रस्तावित सुरक्षा (संदेह पर प्रॉम्प्ट, मॉडल के आंतरिक ज्ञान पर सहमति, दस्तावेजों के बीच मिलान) या तो काम नहीं किया, या नए समस्याएं उत्पन्न की। लेखकों का निष्कर्ष: जांच ऊपर की धारा पर होनी चाहिए - संग्रह के चरण पर, न कि तर्क के चरण पर।

तीसरा तंत्र चित्र को पूरा करता है। कार्य "A Whole New World: Creating a Parallel-Poisoned Web Only AI-Agents Can See" (Shaked Zychlinski) में क्लोकिंग का वर्णन किया गया है, जो विशेष रूप से AI-एजेंटों पर लक्षित है: वेबसाइट एजेंट को ब्राउज़र के गुणों, ऑटोमेशन के फ्रेमवर्क के सिग्नेचर और नेटवर्क विशेषताओं के आधार पर पहचानती है और उसे पृष्ठ का एक अलग संस्करण देती है - छिपी हुई निर्देशों और बदले हुए तथ्यों के साथ। एक व्यक्ति, जिसने वही URL खोला है, सामान्य पृष्ठ देखता है, इसलिए "मैं गया, सब ठीक है" की मैनुअल जांच कुछ भी साबित नहीं करती।

क्यों यह सबसे पहले बजट का सवाल है

टारपिट इस तरह से बनाया गया है कि प्रत्येक पृष्ठ वेबसाइट के लिए सस्ता और आपके लिए महंगा हो। जब ट्रैफिक गीगाबाइट्स के हिसाब से भुगतान किया जाता है, तो अंतहीन पृष्ठों का जनरेटर आपके खर्चों का काउंटर बन जाता है: आप मार्कोव पाठ के मेगाबाइट्स के लिए भुगतान करते हैं, जो कभी भी डेटाबेस में एक पंक्ति नहीं बनेगा। यह वही गणित है जो असफल अनुरोधों के साथ है - गीगाबाइट की कीमत परिणाम की लागत के बारे में कुछ नहीं कहती, जब तक आप एक सफल रिकॉर्ड की लागत नहीं गिनते, न कि अनुरोध की।

इससे पहला व्यावहारिक नियम निकलता है: ट्रैफिक की सीमा डोमेन और कार्य के स्तर पर होनी चाहिए, न कि केवल खाते के स्तर पर। डोमेन, जिसने एक गीगाबाइट से अधिक खा लिया है और कोई रिकॉर्ड नहीं लौटाया है, उसे स्वचालित रूप से रोकना चाहिए - इसके बिना एक जाल रात भर दैनिक बजट को खत्म कर सकता है।

सात चेक जो कचरे को पकड़ते हैं

  1. उपज की गणना करें, न कि उत्तर के कोड। कन्वेयर की मुख्य मैट्रिक - उन अनुरोधों का हिस्सा, जिन्होंने अनिवार्य फ़ील्ड के साथ एक मान्य रिकॉर्ड दिया। जब तक आप 200 की हिस्सेदारी पर ध्यान दे रहे हैं, टारपिट एकदम स्वस्थ स्रोत की तरह दिखता है।
  2. कनारी URL। हर N अनुरोधों में, डोमेन के भीतर जानबूझकर गैर-मौजूद पते का अनुरोध करें - एक यादृच्छिक पथ खंड के साथ। सामान्य वेबसाइट 404 या रीडायरेक्ट के साथ उत्तर देगी, जनरेटर एक पूर्ण पृष्ठ पाठ और लिंक के साथ देगा। यह सबसे सस्ता और सबसे विश्वसनीय चेक है।
  3. दूसरे IP प्रोफाइल से क्रॉस-वैलिडेशन। एक ही URL को दो अलग-अलग मार्गों से लें - उदाहरण के लिए, रिहायशी IP और मोबाइल के माध्यम से - और प्रमुख फ़ील्ड के हैश की तुलना करें: कीमतें, नाम, उपलब्धता। समान URL और निकटतम अनुरोध समय पर भिन्नता का मतलब है कि आपको पृष्ठ के विभिन्न संस्करण दिखाए जा रहे हैं, और उनमें से कम से कम एक मानवों के लिए नहीं है।
  4. अदृश्य लिंक पर न जाएं। nofollow के साथ लिंक, शून्य आकार, display:none या स्क्रीन के बाहर रखे गए - ये प्रलोभन हैं, और उनके माध्यम से जाना वही बॉट का फिंगरप्रिंट है। उन्हें लिंक निकालने के चरण पर फ़िल्टर करें, न कि बाद में।
  5. उत्तर पर कठोर सीमाएँ। न केवल टाइमआउट, बल्कि शरीर के अधिकतम आकार और प्रवेश बिंदु से अधिकतम गहराई को भी सीमित करें। छोटे टुकड़ों में धीमी प्रतिक्रिया - एक गड्ढे का विशिष्ट संकेत है, न कि धीमे सर्वर का।
  6. पाठ की पैटर्न पहचानें। मार्कोव जनरेशन खुद को सांख्यिकी से प्रकट करती है: संदिग्ध रूप से समान पैराग्राफ की लंबाई, "विभिन्न" पृष्ठों के बीच दोहराए जाने वाले n-ग्राम, कीमत, आर्टिकल या तारीख जैसे संरचनात्मक तत्वों की अनुपस्थिति में दर्जनों आउटगोइंग लिंक। डोमेन के पड़ोसी पृष्ठों के बीच दोहराए जाने वाले शिंगल्स पर एक साधारण जांच ऐसे स्रोतों को एक झटके में काट देती है।
  7. संख्याओं की वास्तविकता की जांच करें। ऐतिहासिक गलियारे से बाहर की कीमत, आपकी ब्रांडों की डेटाबेस में एक भी मेल न होना, विविधता में अचानक वृद्धि - ये मान्यकरण के नियम हैं, जो रिकॉर्ड में डालने से पहले होने चाहिए, न कि एक महीने बाद रिपोर्ट में। खासकर जब डेटा फिर मॉडल में या खरीद के स्वचालित निर्णय में जाता है।

पहले से एकत्रित डेटा के साथ क्या करें

यदि संदेह बाद में उत्पन्न हुआ, तो तिथियों के बजाय स्रोतों के अनुसार क्रमबद्ध करें। रिकॉर्ड को डोमेन के अनुसार समूहित करें और तीन माप पर ध्यान दें: अनिवार्य फ़ील्ड के बिना पृष्ठों का हिस्सा, पृष्ठ पर आउटगोइंग लिंक की औसत संख्या और पाठ की लंबाई का फैलाव। जाल डोमेन आमतौर पर तुरंत सभी तीनों पर स्पष्ट होते हैं। फिर चयनात्मक रूप से विवादास्पद URL को दूसरे IP प्रोफाइल से पुनः जांचें - यदि डेटा मेल नहीं खाते हैं, तो उस डोमेन से पूरा डेटा फिर से एकत्रित करना चाहिए, न कि फ़िल्टरों से ठीक करना।

एजेंट परिदृश्यों के लिए नियमों पर अलग से विचार करना चाहिए, जहां मॉडल स्वयं पृष्ठों पर जाती है और स्वयं निर्णय लेती है। वहीं एक पृष्ठ के बदलने से अधिकतम प्रभाव मिलता है, और श्रृंखला में कोई मध्यवर्ती व्यक्ति नहीं होता जो अजीबता को देख सके। न्यूनतम बीमा - दो स्वतंत्र स्रोतों से तथ्य की पुष्टि की मांग करना और एजेंट को एकमात्र डोमेन से प्राप्त डेटा के आधार पर कार्य करने की अनुमति नहीं देना।

संक्षेप में

बॉट्स ने लंबे समय से ट्रैफिक के हिस्से में मनुष्यों को पीछे छोड़ दिया है, और सुरक्षा ने केवल फ़िल्टरों के माध्यम से प्रतिक्रिया नहीं दी: आज ऑटोमेटेड को विश्वसनीय कचरा खिलाना सस्ता है, बजाय इसके कि उसके साथ ब्लॉकिंग में झगड़ा किया जाए। व्यावहारिक परिणाम तीन हैं। उपयोगी रिकॉर्ड की गणना करें, न कि उत्तर की स्थिति। प्रत्येक डोमेन के लिए कनारी चेक और ट्रैफिक सीमाएँ रखें। विवादास्पद पृष्ठों की तुलना विभिन्न IP प्रोफाइल से करें - एक ही पृष्ठ के संस्करणों में भिन्नता यही प्रमाण है कि आपको विशेष रूप से बॉट्स के लिए तैयार किया गया इंटरनेट दिखाया जा रहा है। इस योजना में प्रॉक्सी केवल एक कार्य को हल करती है - पृष्ठ पर स्वतंत्र दूसरा दृष्टिकोण प्रदान करती है; बाकी सब आपकी ओर से मान्यता है।