Back to Blog

2026 में बिना बैन के LinkedIn को कैसे पार्स करें: गाइड और कौन से प्रॉक्सी चाहिए

LinkedIn ने hiQ के खिलाफ मुकदमा जीत लिया, Proxycurl को बंद कर दिया और IP, TLS-फिंगरप्रिंट और व्यवहार के स्तर पर बॉट्स को रोक रहा है। हम चरण दर चरण समझते हैं कि 2026 में LinkedIn के सार्वजनिक डेटा को कानूनी रूप से कैसे पार्स किया जाए, जहां कानूनी सीमा है और कौन से प्रॉक्सी - निवासी और मोबाइल - वास्तव में लोड को संभालते हैं।

📅July 18, 2026
2026 में बिना बैन के LinkedIn को कैसे पार्स करें: गाइड और कौन से प्रॉक्सी चाहिए
```html

LinkedIn — सबसे बंद प्लेटफार्मों में से एक और एक ही समय में B2B डेटा का सबसे आकर्षक स्रोत है: विशेषज्ञों के प्रोफाइल, कंपनियाँ, नौकरियाँ, लीड जनरेशन और भर्ती के लिए अंतर्दृष्टि। 2026 में इन डेटा को इकट्ठा करना काफी कठिन और जोखिम भरा हो गया। LinkedIn ने hiQ Labs के खिलाफ मुकदमा जीता, सबसे बड़े स्क्रैपिंग सेवा Proxycurl पर मुकदमा किया और बंद कर दिया, और तकनीकी स्तर पर बॉट्स को पहले से ही छानने में सक्षम हो गया, इससे पहले कि आप पहला HTML पंक्ति प्राप्त करें। हम कदम दर कदम देखते हैं कि 2026 में LinkedIn के सार्वजनिक डेटा को कैसे पार्स करें, जहाँ कानूनी और तकनीकी सीमा होती है और कौन से प्रॉक्सी वास्तव में लोड को सहन करते हैं।

किसके लिए और क्यों यह आवश्यक है

LinkedIn का स्क्रैपिंग कोई "ग्रे हैक" नहीं है, बल्कि पूरी तरह से कानूनी कार्यों के लिए एक कार्यात्मक उपकरण है: B2B बिक्री के लिए लीड इकट्ठा करना, श्रम बाजार और वेतन का विश्लेषण, प्रतिस्पर्धियों और उनकी भर्ती की निगरानी, CRM का समृद्धिकरण, उद्योगों का अध्ययन। समस्या यह है कि LinkedIn अपने डेटा को एक संपत्ति के रूप में मानता है और इसे किसी अन्य सोशल नेटवर्क की तुलना में अधिक आक्रामकता से सुरक्षित करता है। इसलिए पहले अनुरोध लिखने से पहले, आपको दो बातें समझनी चाहिए: कानून के अनुसार क्या इकट्ठा किया जा सकता है और क्यों सामान्य कोड पांच मिनट में दीवार पर रुक जाता है

कानूनी सीमा: 2026 ने क्या दिखाया

मुख्य भ्रांति — "डेटा सार्वजनिक हैं, इसलिए उन्हें स्वतंत्र रूप से लिया जा सकता है"। पिछले वर्षों का न्यायिक अभ्यास इसके विपरीत कहता है।

मामला hiQ Labs बनाम LinkedIn को लंबे समय तक स्क्रैपर्स की जीत माना गया: 2019 और 2022 में नौंवे सर्किट अपीलेट कोर्ट ने कहा कि सार्वजनिक प्रोफाइल तक पहुंचना CFAA एंटी-हैकिंग कानून का उल्लंघन नहीं करता। लेकिन नवंबर 2022 में, उसी अदालत ने वास्तव में LinkedIn के पक्ष में फैसला सुनाया: उपयोगकर्ता समझौते में स्क्रैपिंग पर प्रतिबंध को कानूनी रूप से एक संविदात्मक दायित्व के रूप में मान्यता दी गई। 7 दिसंबर 2022 को पक्षों ने एक समझौते पर हस्ताक्षर किए — hiQ से 500,000 डॉलर की वसूली की गई (अनुबंध का उल्लंघन और फर्जी खातों के कारण CFAA) और सभी कोड और एकत्रित डेटा को नष्ट करने की अनिवार्यता के साथ स्थायी प्रतिबंध लगाया गया। कंपनी hiQ का अस्तित्व समाप्त हो गया।

दूसरा उदाहरण — Proxycurl (कंपनी Nubela), LinkedIn डेटा के लिए सबसे बड़ा API। 24 जनवरी 2025 को LinkedIn ने इसके खिलाफ कैलिफोर्निया के उत्तरी जिले में छह आधारों पर संघीय मुकदमा दायर किया: अनुबंध का उल्लंघन, धोखाधड़ी, CFAA, कैलिफोर्निया का अनुचित प्रतिस्पर्धा कानून और अन्य। Proxycurl पर लाखों प्रोफाइल इकट्ठा करने के लिए सैकड़ों हजारों फर्जी खातों के निर्माण का आरोप लगाया गया। मामला 2025 के मध्य में सुलझा: जुलाई में सेवा ने ग्राहकों से विदाई ली और बंद हो गई। संस्थापक ने सीधे लिखा कि व्यवसाय ने लगभग 10 मिलियन डॉलर की आय उत्पन्न की, जिसमें से लगभग आधा LinkedIn के स्क्रैपिंग से आया, और "इस लड़ाई में जीतना संभव नहीं है" एक कंपनी के खिलाफ जिसके पास वास्तव में असीमित कानूनी बजट है। प्रतिबंध की शर्तें Proxycurl के ग्राहकों पर भी लागू होती थीं।

व्यवहार में निष्कर्ष अत्यंत स्पष्ट है:

  • लॉगिन न करें। जैसे ही आप प्रमाणित होते हैं, आप उपयोगकर्ता समझौते को स्वीकार करते हैं, जो किसी भी स्वचालित संग्रह को प्रतिबंधित करता है। खाते से स्क्रैपिंग अनुबंध का सीधा उल्लंघन है, जिस पर LinkedIn मुकदमे जीतता है।
  • कोई फर्जी खाते नहीं। hiQ और Proxycurl दोनों को वास्तव में फर्जी प्रोफाइल की संख्या ने "डूबो दिया" — यह CFAA का एक अलग उल्लंघन है।
  • जहाँ संभव हो केवल सार्वजनिक और गैर-व्यक्तिगत डेटा इकट्ठा करें। यहाँ GDPR भी शामिल है: बिना कानूनी आधार के EU में खुले प्रोफाइल से व्यक्तिगत डेटा इकट्ठा करना उल्लंघन माना जाता है — इस तर्क को यूरोपीय नियामक ने अलग से स्थापित किया है, और हमने इसे GDPR के तहत स्क्रैपिंग पर सामग्री में विस्तार से चर्चा की।

साधारण शब्दों में, प्रॉक्सी तकनीकी पहुंच की समस्या को हल करती हैं, लेकिन कानूनी आधार प्रदान नहीं करती हैं। अनुपालन इस बात में है कि क्या और क्यों आप इकट्ठा कर रहे हैं, न कि किस IP के माध्यम से।

क्यों सामान्य स्क्रिप्ट पांच मिनट में मर जाती है

LinkedIn ने बहुस्तरीय सुरक्षा स्थापित की है, और इसकी संरचना को समझना सीधे तौर पर यह निर्धारित करता है कि आपको क्या चाहिए।

प्रमाणीकरण की दीवार

सार्वजनिक रूप से, बिना लॉगिन के, बुनियादी प्रोफाइल, कंपनी का अवलोकन, नौकरियाँ और नौकरी खोज उपलब्ध हैं। लेकिन केवल 3-5 प्रोफाइल देखने के बाद LinkedIn लॉगिन विंडो दिखाता है। यह कोई बग नहीं है — यह पहला मोर्चा है: प्लेटफार्मा जानबूझकर गुमनाम दृश्यता को सीमित करता है।

व्यवहारात्मक विश्लेषण

दूसरी परत यह ट्रैक करती है कि आप साइट पर कैसे चलते हैं: अनुरोधों के बीच का समय (एक व्यक्ति एक मिनट में 100 प्रोफाइल नहीं खोलता), नेविगेशन के पैटर्न, माउस की गति, संक्रमणों की श्रृंखला (referrer)। सभी संकेत "fraud score" में संकलित होते हैं और जीवित उपयोगकर्ता के सामान्य व्यवहार से तुलना की जाती हैं।

अनुरोध का फिंगरप्रिंटिंग

तीसरी परत — कनेक्शन का फिंगरप्रिंट। LinkedIn IP की गुणवत्ता का विश्लेषण करता है (घरेलू नेटवर्क से निवासी या होस्टिंग से डेटा सेंटर), TLS/JA3 क्लाइंट फिंगरप्रिंट, हेडर और कुकीज़, डिवाइस का मेटाडेटा। यदि TLS फिंगरप्रिंट python-requests दिखाता है, न कि असली Chrome, तो आप तुरंत देखे जाते हैं — यहां तक कि एक आदर्श निवासी प्रॉक्सी के माध्यम से भी।

एक अलग मार्कर, जिसे आप पहले देखेंगे, है HTTP-स्टेटस 999. यह एक असामान्य कोड है, जो LinkedIn के लिए अद्वितीय है: प्लेटफार्मा संदिग्ध ट्रैफ़िक पर इस तरह प्रतिक्रिया करता है। इसे गैर-ब्राउज़र User-Agent (curl, python-requests, wget), एक IP या नेटवर्क से उच्च अनुरोध आवृत्ति, डेटा सेंटर और क्लाउड रेंज, robots.txt की अनदेखी द्वारा उत्तेजित किया जाता है। यदि आपको 999 मिलता है — तो उस IP से अनुरोध बंद कर दें, 30-60 सेकंड प्रतीक्षा करें और अन्य प्रॉक्सी का प्रयास करें।

2026 में LinkedIn को कैसे पार्स करें: चरण दर चरण

  1. प्रवेश बिंदु निर्धारित करें। LinkedIn पर HTML का DOM-स्क्रैपिंग 2026 में लगभग काम नहीं करता — मार्कअप गतिशील और उलझा हुआ है। डेटा प्रोफाइल, कंपनियों और नौकरियों के पृष्ठों पर application/ld+json टैग के माध्यम से दिया जाता है, और साथ ही आंतरिक XHR-पैजिनेशन एंडपॉइंट्स (उदाहरण के लिए, seeMoreJobPostings/search?start=25 25 परिणामों के कदम के साथ)। मुख्य "जीवित" स्रोत LinkedIn का आंतरिक REST इंटरफेस (Voyager API) है, जो स्वयं साइट को शक्ति प्रदान करता है। महत्वपूर्ण: यह API दस्तावेजित नहीं है, LinkedIn इसका दुरुपयोग करने के लिए सक्रिय रूप से इसकी निगरानी करता है और Voyager के माध्यम से काम करने वाले खातों को 3-7 दिनों में बैन कर देता है. इसलिए सुरक्षित रहना बेहतर है कि आप बिना प्रमाणन के सार्वजनिक पृष्ठों तक सीमित रहें।
  2. TLS स्तर पर असली ब्राउज़र का अनुकरण करें। हेडर में ब्राउज़र User-Agent को बदलना पर्याप्त नहीं है। एक क्लाइंट की आवश्यकता है जिसमें Chrome-संगत TLS और HTTP/2 फिंगरप्रिंट हो: जैसे curl_cffi (impersonate), uTLS या हेडलेस ब्राउज़र (Playwright/Puppeteer के साथ stealth-config)। निवासी प्रॉक्सी जिसका फिंगरप्रिंट python-requests है, फिर भी विफल हो जाएगा।
  3. सही प्रॉक्सी कनेक्ट करें और सत्र के अनुसार रोटेट करें। यदि आप पृष्ठों के बीच कुकी सत्रों को बनाए रखना चाहते हैं, तो IP को सत्र पर रोटेट करें, न कि प्रत्येक अनुरोध पर. एक ही तार्किक श्रृंखला के भीतर IP को बार-बार बदलना संदिग्ध लगता है।
  4. मानव गति बनाए रखें। 2026 में सुरक्षित सीमा — प्रति घंटे एक IP से लगभग 20-30 प्रोफाइल के लिए अनुरोध; इससे अधिक होने पर रेट लिमिटिंग सक्रिय हो जाती है। अनुरोधों के बीच यादृच्छिक विराम रखें (सभी के लिए निश्चित 1.5 सेकंड नहीं), क्रम और अंतराल को यादृच्छिक बनाएं। प्रोफाइल देखने के बीच का अंतराल उनके कुल संख्या से अधिक महत्वपूर्ण है।
  5. छोटे समांतरता से शुरू करें। एक साथ 50 थ्रेड न चलाएं। 2-3 समवर्ती सत्रों के साथ शुरू करें और 999-उत्तर और कैप्चा की दर को देखते हुए बढ़ाएं।
  6. ब्लॉक को सही तरीके से संभालें। 999 और कैप्चा को एक संकेत के रूप में पकड़ें, न कि एक गलती के रूप में: गति को कम करें, प्रॉक्सी बदलें, विराम लें। प्रत्येक IP पूल के लिए सफलता दर को लॉग करें — इससे पता चलता है कि कब पूल "बंद" हो गया।

पानी के नीचे की चट्टानें

  • “पूर्ण” डेटा के लिए प्रमाणित होने का प्रलोभन। लोगों की खोज, कंपनियों के विस्तृत डेटा और भर्ती उपकरण केवल लॉगिन के तहत उपलब्ध हैं — लेकिन यही लॉगिन संग्रह को ToS का उल्लंघन बनाता है और आपके खाते को 3-7 दिनों में बैन करने के लिए जोखिम में डालता है। जोखिम को तर्कसंगत रूप से तौलें।
  • डेटा सेंटर प्रॉक्सी। LinkedIn होस्टिंग प्रदाताओं के ASN ब्लॉक लिस्ट को बनाए रखता है और नए डेटा सेंटर IP को मिनटों में चिह्नित करता है। LinkedIn के लिए यह लगभग निश्चित 999 है।
  • फर्जी खाते। तकनीकी रूप से आकर्षक, कानूनी रूप से — CFAA के तहत मुकदमे का सीधा रास्ता। 2022 और 2025 के दोनों प्रमुख मामलों ने इसी पर निर्भर किया।
  • व्यक्तिगत डेटा और GDPR। "प्रोफाइल खुला है" का अर्थ "डेटा को संसाधित किया जा सकता है" नहीं है। EU के दर्शकों के लिए कानूनी आधार की आवश्यकता होती है, चाहे प्रॉक्सी कोई भी हो।
  • फ्री प्रॉक्सी। सार्वजनिक IP सूची लंबे समय से LinkedIn की काली सूचियों में हैं और अक्सर समझौता की गई हैं — पैसे और समय की बर्बादी।

LinkedIn के लिए कौन से प्रॉक्सी आवश्यक हैं — और क्यों

यहाँ प्रॉक्सी का प्रकार कोड स्क्रैपर से अधिक महत्वपूर्ण है। 2026 के लिए स्थिति इस प्रकार है:

  • डेटा सेंटर — काम नहीं करते। LinkedIn तुरंत होस्टिंग ASN को पहचानता है। इस प्लेटफार्म के लिए डेटा सेंटर लगभग पूरी तरह से बाहर हो जाता है, चाहे वह कितना भी सस्ता क्यों न हो।
  • निवासी — अनिवार्य न्यूनतम। ये वास्तविक घरेलू इंटरनेट सेवा प्रदाताओं के IP हैं: सिस्टम के लिए अनुरोध एक सामान्य अपार्टमेंट से आता है। रोटेटिंग निवासी प्रॉक्सी "सफल अनुरोध के लिए कीमत" का सबसे अच्छा अनुपात प्रदान करते हैं और उद्योग मानकों के अनुसार 85-92% सफल अनुरोधों को बनाए रखते हैं। यह सार्वजनिक प्रोफाइल और नौकरियों के बड़े पैमाने पर संग्रह के लिए आधार है।
  • मोबाइल — LinkedIn के लिए उच्चतम श्रेणी। मोबाइल 4G/5G प्रॉक्सी CGNAT के तहत ऑपरेटर IP का उपयोग करते हैं, जो हजारों वास्तविक ग्राहकों को साझा करते हैं। LinkedIn ऐसे IP को बैन नहीं कर सकता है, बिना कई वैध मोबाइल उपयोगकर्ताओं को प्रभावित किए — इसलिए मोबाइल पते प्लेटफार्म के लिए जीवित ट्रैफ़िक से लगभग अप्रभेद्य होते हैं। प्रति गीगाबाइट महंगे होते हैं, लेकिन सबसे संवेदनशील परिदृश्यों और उच्च गति पर लाभकारी होते हैं।

2026 के लिए व्यावहारिक संयोजन: मुख्य मात्रा के लिए निवासी प्रॉक्सी और "भारी" क्षेत्रों और उच्च समांतरता के लिए मोबाइल — और निश्चित रूप से Chrome-संगत TLS फिंगरप्रिंट के ऊपर। बिना सही फिंगरप्रिंट के प्रॉक्सी मदद नहीं करेंगी, और सही फिंगरप्रिंट बिना गुणवत्ता IP के 999 में रुक जाएगा।

निष्कर्ष

2026 में LinkedIn का पार्सिंग "requests सेट किया और चल दिया" के बारे में नहीं है। प्लेटफार्म ने प्रमुख मुकदमे जीते हैं, पूरे सेवाओं को बंद कर दिया है और IP, TLS फिंगरप्रिंट और व्यवहार के स्तर पर बॉट्स को काटता है। कार्यशील रणनीति: केवल सार्वजनिक और बिना लॉगिन के इकट्ठा करें, फर्जी खातों को न बढ़ाएं, प्रति IP प्रति घंटे 20-30 अनुरोधों की मानव गति बनाए रखें, TLS स्तर पर असली ब्राउज़र का अनुकरण करें और गुणवत्ता प्रॉक्सी अवसंरचना पर निर्भर रहें — निवासी IP को आधार के रूप में और मोबाइल को सुदृढ़ीकरण के रूप में। मूल्य कोड से पहचान की परत में स्थानांतरित हो गया है: जीतता है वह, जिसके पास साफ, जीवित उपयोगकर्ता IP है। स्क्रैपिंग कार्यों के लिए निवास और मोबाइल प्रॉक्सी का चयन ProxyCove के कैटलॉग में किया जा सकता है — भू-लक्षित और आवश्यक गति के अनुसार रोटेशन के साथ।

```