بازگشت به وبلاگ

چگونه در سال 2026 بدون مسدود شدن از LinkedIn داده‌برداری کنیم: راهنما و پروکسی‌های مورد نیاز

لینکدین در دادگاه برنده hiQ شد، Proxycurl را بست و ربات‌ها را در سطح IP، اثر انگشت TLS و رفتار قطع می‌کند. به صورت مرحله به مرحله بررسی می‌کنیم که چگونه می‌توان به طور قانونی داده‌های عمومی لینکدین را در سال ۲۰۲۶ استخراج کرد، کجا مرز قانونی قرار دارد و کدام پروکسی‌ها — مقیم و موبایل — واقعاً بار را تحمل می‌کنند.

📅۲۷ تیر ۱۴۰۵
چگونه در سال 2026 بدون مسدود شدن از LinkedIn داده‌برداری کنیم: راهنما و پروکسی‌های مورد نیاز
```html

لینکدین — یکی از بسته‌ترین پلتفرم‌های بزرگ و در عین حال جذاب‌ترین منبع داده‌های B2B است: پروفایل‌های متخصصان، شرکت‌ها، آگهی‌های استخدام، بینش‌ها برای تولید سرنخ و استخدام. در سال 2026 جمع‌آوری این داده‌ها به وضوح دشوارتر و پرخطرتر شده است. لینکدین در دادگاهی برنده شد و بزرگ‌ترین سرویس اسکرپینگ Proxycurl را به دادگاه کشاند و بست. در سطح فنی، لینکدین یاد گرفته است که ربات‌ها را حتی قبل از اینکه شما اولین خط HTML را دریافت کنید، شناسایی کند. در اینجا مراحل جمع‌آوری داده‌های عمومی لینکدین در سال 2026، جایی که مرزهای قانونی و فنی قرار دارد و کدام پروکسی‌ها واقعاً بار را تحمل می‌کنند، بررسی می‌شود.

برای چه کسانی و چرا این نیاز است

اسکرپینگ لینکدین نه یک «هک خاکستری» بلکه ابزاری کارآمد برای وظایف کاملاً قانونی است: جمع‌آوری سرنخ‌ها برای فروش B2B، تحلیل بازار کار و حقوق، نظارت بر رقبا و استخدام آن‌ها، غنی‌سازی CRM و تحقیق در صنایع. مشکل این است که لینکدین به داده‌های خود به عنوان یک دارایی نگاه می‌کند و آن‌ها را به شدت محافظت می‌کند. بنابراین قبل از نوشتن اولین درخواست، باید دو نکته را درک کنید: چه چیزی را می‌توان به طور قانونی جمع‌آوری کرد و چرا کد معمولی در عرض پنج دقیقه به دیوار می‌خورد.

مرز قانونی: چه چیزی سال 2026 نشان داد

بزرگترین اشتباه — «داده‌ها عمومی هستند، بنابراین می‌توان آن‌ها را به راحتی برداشت». رویه‌های قضایی سال‌های اخیر به طور معکوس می‌گویند.

پرونده hiQ Labs علیه لینکدین مدت‌ها به عنوان پیروزی اسکرپرها در نظر گرفته می‌شد: دادگاه تجدیدنظر ناحیه نهم در سال‌های 2019 و 2022 اشاره کرد که دسترسی به پروفایل‌های عمومی به قانون ضد هک CFAA آسیب نمی‌زند. اما در نوامبر 2022، همان دادگاه به طور اساسی به نفع لینکدین قرار گرفت: ممنوعیت اسکرپینگ در توافق‌نامه کاربری به عنوان یک تعهد قراردادی به رسمیت شناخته شد. در 7 دسامبر 2022، طرفین توافق صلحی را ثبت کردند — از hiQ 500,000 دلار جریمه گرفته شد (نقض قرارداد به علاوه CFAA به دلیل حساب‌های جعلی) و ممنوعیت دائمی با الزام به نابودی تمام کد و داده‌های جمع‌آوری شده وضع شد. شرکت hiQ منحل شد.

دومین مورد قابل توجه — Proxycurl (شرکت Nubela)، بزرگترین API برای داده‌های لینکدین. در 24 ژانویه 2025، لینکدین علیه آن شکایت فدرال در ناحیه شمال کالیفرنیا به شش دلیل مختلف ارائه داد: نقض قرارداد، کلاهبرداری، CFAA، قانون کالیفرنیا در مورد رقابت ناعادلانه و دیگر موارد. Proxycurl به ایجاد صدها هزار حساب جعلی برای جمع‌آوری میلیون‌ها پروفایل، از جمله داده‌های غیر عمومی متهم شد. این پرونده در نیمه سال 2025 حل و فصل شد: در ژوئیه، سرویس با مشتریان وداع کرد و بسته شد. بنیان‌گذار به صراحت نوشت که کسب‌وکار حدود 10 میلیون دلار درآمد داشت، که تقریباً نیمی از آن از اسکرپینگ لینکدین بود و «در این مبارزه نمی‌توان برنده شد» در برابر شرکتی با بودجه حقوقی عملاً نامحدود. شرایط ممنوعیت شامل مشتریان Proxycurl نیز می‌شد.

نتیجه‌گیری برای عمل به شدت مشخص است:

  • وارد نشوید. به محض اینکه شما وارد شوید، توافق‌نامه کاربری را می‌پذیرید که هرگونه جمع‌آوری خودکار را ممنوع می‌کند. اسکرپینگ از حساب کاربری نقض مستقیم قرارداد است، و لینکدین دقیقاً بر همین اساس در دادگاه‌ها پیروز می‌شود.
  • هیچ حساب جعلی. هم hiQ و هم Proxycurl به خاطر انبوهی از پروفایل‌های جعلی «غرق» شدند — این یک نقض جداگانه از CFAA است.
  • فقط داده‌های عمومی و غیر شخصی را جمع‌آوری کنید. در اینجا GDPR اضافه می‌شود: جمع‌آوری داده‌های شخصی حتی از پروفایل‌های باز بدون مبنای قانونی در اتحادیه اروپا نقض محسوب می‌شود — این منطق به طور جداگانه توسط نهاد نظارتی اروپایی تأسیس شده است و ما آن را به تفصیل در مطلبی درباره اسکرپینگ تحت GDPR بررسی کردیم.

به عبارت ساده، پروکسی‌ها مشکل فنی دسترسی را حل می‌کنند، اما مبنای قانونی را ارائه نمی‌دهند. تطابق — در این است که چه و چرا شما جمع‌آوری می‌کنید، نه اینکه از کدام IP.

چرا یک اسکریپت معمولی در عرض پنج دقیقه می‌میرد

لینکدین یک سیستم چند لایه محافظتی ایجاد کرده است و درک ساختار آن به طور مستقیم تعیین می‌کند که شما به چه چیزی نیاز دارید.

دیوار احراز هویت

به صورت عمومی، بدون ورود، پروفایل پایه، صفحه نمایشی شرکت، آگهی‌های استخدام و جستجوی آگهی‌ها در دسترس است. اما پس از مشاهده تنها 3–5 پروفایل، لینکدین پنجره ورود را نشان می‌دهد. این یک باگ نیست — این اولین خط دفاعی است: پلتفرم به طور عمدی مشاهده ناشناس را محدود می‌کند.

تحلیل رفتاری

لایه دوم رفتار شما را در سایت ردیابی می‌کند: زمان‌های بین درخواست‌ها (یک انسان 100 پروفایل در دقیقه باز نمی‌کند)، الگوهای ناوبری، حرکات ماوس، زنجیره انتقال (referrer). تمام سیگنال‌ها به «نمره تقلب» تبدیل می‌شوند و با رفتار معمولی یک کاربر زنده مقایسه می‌شوند.

اثر انگشت درخواست

لایه سوم — اثر انگشت اتصال. لینکدین کیفیت IP را تحلیل می‌کند (از شبکه خانگی یا از دیتاسنتر)، اثر انگشت TLS/JA3 مشتری، هدرها و کوکی‌ها، متاداده‌های دستگاه. اگر اثر انگشت TLS python-requests را نشان دهد و نه کروم واقعی، شما به سرعت شناسایی می‌شوید — حتی از طریق یک پروکسی خانگی ایده‌آل.

علامت جداگانه‌ای که شما ابتدا با آن مواجه می‌شوید — HTTP-status 999. این یک کد غیر استاندارد است، منحصر به فرد برای لینکدین: این پلتفرم به ترافیک مشکوک پاسخ می‌دهد. این وضعیت توسط User-Agent‌های غیر مرورگری (curl، python-requests، wget)، فرکانس بالای درخواست‌ها از یک IP یا شبکه، دامنه‌های دیتاسنتر و ابری، و نادیده گرفتن robots.txt تحریک می‌شود. اگر 999 دریافت کردید — درخواست‌ها را از این IP متوقف کنید، 30–60 ثانیه صبر کنید و پروکسی دیگری را امتحان کنید.

چگونه لینکدین را در 2026 اسکرپ کنید: مرحله به مرحله

  1. نقطه ورود را تعیین کنید. DOM-اسکرپینگ HTML در لینکدین در سال 2026 تقریباً کار نمی‌کند — نشانه‌گذاری دینامیک و پیچیده است. داده‌ها از طریق تگ‌های application/ld+json در صفحات پروفایل‌ها، شرکت‌ها و آگهی‌ها و همچنین از طریق نقاط پایانی داخلی XHR برای صفحه‌بندی (به عنوان مثال، seeMoreJobPostings/search?start=25 با گام 25 نتیجه) ارائه می‌شوند. منبع «زنده» اصلی — رابط REST داخلی لینکدین (API Voyager) است که خود سایت را تغذیه می‌کند. مهم است: این API مستند نشده است، لینکدین به طور فعال آن را برای سوء استفاده‌ها نظارت می‌کند و حساب‌هایی که از طریق Voyager کار می‌کنند را در عرض 3–7 روز مسدود می‌کند. به همین دلیل، محدود کردن به صفحات عمومی بدون احراز هویت ایمن‌تر است.
  2. یک مرورگر واقعی را در سطح TLS جعل کنید. کافی نیست که User-Agent مرورگر را در هدرها قرار دهید. به یک مشتری با اثر انگشت TLS و HTTP/2 سازگار با کروم نیاز دارید: کتابخانه‌هایی مانند curl_cffi (impersonate)، uTLS یا مرورگر بدون سر (Playwright/Puppeteer با پیکربندی stealth). پروکسی خانگی با اثر انگشت python-requests همچنان شکست خواهد خورد.
  3. پروکسی‌های مناسب را متصل کنید و در طول جلسه چرخش کنید. IP را در طول جلسه، نه برای هر درخواست بچرخانید، اگر می‌خواهید کوکی‌های جلسه را بین صفحات حفظ کنید. تغییر مکرر IP در یک زنجیره منطقی دقیقاً مشکوک به نظر می‌رسد.
  4. سرعت انسانی را حفظ کنید. در سال 2026، آستانه ایمن — حدود 20–30 درخواست به پروفایل‌ها از یک IP در ساعت است؛ بالاتر از این، محدودیت نرخ فعال می‌شود. بین درخواست‌ها وقفه‌های تصادفی قرار دهید (نه 1.5 ثانیه ثابت برای همه)، ترتیب و فواصل را تصادفی کنید. فاصله بین مشاهده پروفایل‌ها مهم‌تر از تعداد کل آن‌ها است.
  5. با هم‌زمانی کم شروع کنید. 50 رشته را به طور همزمان راه‌اندازی نکنید. با 2–3 جلسه همزمان شروع کنید و با نظارت بر سهم پاسخ‌های 999 و CAPTCHA افزایش دهید.
  6. مسدودیت‌ها را به درستی مدیریت کنید. 999 و CAPTCHA را به عنوان سیگنال و نه خطا در نظر بگیرید: سرعت را کاهش دهید، پروکسی را تغییر دهید، وقفه بگذارید. نرخ موفقیت را برای هر مجموعه IP ثبت کنید — از آنجا می‌توان فهمید که چه زمانی مجموعه «سوخته» است.

چالش‌ها

  • وسوسه ورود برای داده‌های «کامل». جستجوی افراد، داده‌های گسترش‌یافته شرکت‌ها و ابزارهای استخدام فقط تحت ورود در دسترس هستند — اما ورود دقیقاً جمع‌آوری را به نقض ToS تبدیل می‌کند و حساب شما را در معرض مسدودیت در 3–7 روز قرار می‌دهد. ریسک را به طور منطقی ارزیابی کنید.
  • پروکسی‌های دیتاسنتری. لینکدین لیست‌های مسدود کننده ASN ارائه‌دهندگان میزبانی را نگه می‌دارد و IP‌های جدید دیتاسنتری را در عرض چند دقیقه علامت‌گذاری می‌کند. برای لینکدین، این تقریباً یک 999 تضمینی است.
  • حساب‌های جعلی. از نظر فنی وسوسه‌انگیز است، اما از نظر قانونی — راهی مستقیم به شکایت بر اساس CFAA. هر دو پرونده بزرگ سال‌های 2022 و 2025 بر این اساس استوار بودند.
  • داده‌های شخصی و GDPR. «پروفایل باز است» به معنای «داده‌ها قابل پردازش هستند» نیست. برای مخاطبان از اتحادیه اروپا، نیاز به مبنای قانونی وجود دارد، صرف نظر از پروکسی.
  • پروکسی‌های رایگان. لیست‌های عمومی IP مدت‌هاست که در لیست‌های سیاه لینکدین قرار دارند و اغلب به خطر افتاده‌اند — پول و زمان هدر رفته است.

کدام پروکسی‌ها برای لینکدین نیاز است — و چرا

نوع پروکسی در اینجا بیشتر از خود کد اسکرپر اهمیت دارد. وضعیت برای سال 2026 به این صورت است:

  • پروکسی‌های دیتاسنتری — کار نمی‌کنند. لینکدین به سرعت ASN‌های میزبانی را شناسایی می‌کند. برای این پلتفرم، دیتاسنتر تقریباً به طور کامل رد می‌شود، هرچقدر هم که ارزان باشد.
  • پروکسی‌های خانگی — حداقل الزامی. این IP‌های ارائه‌دهندگان اینترنت خانگی واقعی هستند: برای سیستم تشخیص، درخواست به نظر می‌رسد که از یک آپارتمان معمولی آمده است. پروکسی‌های خانگی چرخشی بهترین نسبت «قیمت به درخواست موفق» را ارائه می‌دهند و در اندازه‌گیری‌های صنعتی 85–92% درخواست‌های موفق را حفظ می‌کنند. این پایه‌ای برای جمع‌آوری پروفایل‌های عمومی و آگهی‌ها در حجم بالا است.
  • پروکسی‌های موبایلی — کلاس برتر برای لینکدین. پروکسی‌های موبایلی 4G/5G از IP‌های اپراتوری تحت CGNAT استفاده می‌کنند که هزاران مشترک واقعی را تقسیم می‌کنند. لینکدین نمی‌تواند چنین IP‌ای را مسدود کند بدون اینکه تعداد زیادی از کاربران موبایل قانونی را تحت تأثیر قرار دهد — بنابراین آدرس‌های موبایلی برای این پلتفرم تقریباً از ترافیک زنده غیرقابل تشخیص هستند. هزینه آن‌ها برای هر گیگابایت بیشتر است، اما در سناریوهای حساس و با سرعت بالا بازدهی دارند.

ترکیب عملی برای سال 2026: پروکسی‌های خانگی برای حجم اصلی به علاوه پروکسی‌های موبایلی برای بخش‌های «سنگین» و هم‌زمانی بالا — و حتماً بر روی اثر انگشت TLS سازگار با کروم. پروکسی بدون اثر انگشت صحیح نجات‌دهنده نخواهد بود، و اثر انگشت صحیح بدون IP با کیفیت به 999 برخورد خواهد کرد.

نتیجه‌گیری

اسکرپینگ لینکدین در سال 2026 — این نیست که «requests را قرار دهید و بروید». این پلتفرم در دادگاه‌های کلیدی پیروز شده، سرویس‌های کامل را بسته و ربات‌ها را در سطح IP، اثر انگشت TLS و رفتار شناسایی می‌کند. استراتژی کارآمد: فقط داده‌های عمومی و بدون ورود را جمع‌آوری کنید، حساب‌های جعلی تولید نکنید، سرعت انسانی 20–30 درخواست در ساعت برای هر IP را حفظ کنید، مرورگر واقعی را در سطح TLS جعل کنید و به زیرساخت پروکسی با کیفیت تکیه کنید — IP‌های خانگی به عنوان پایه و موبایلی به عنوان تقویت. ارزش از کد به لایه هویتی منتقل شده است: برنده کسی است که IP تمیز و غیرقابل تشخیص از کاربر زنده دارد. می‌توانید پروکسی‌های خانگی و موبایلی را برای نیازهای اسکرپینگ در فهرست ProxyCove پیدا کنید — با هدف‌گذاری جغرافیایی و چرخش بر اساس سرعت مورد نیاز.

```