Quay lại blog

Cách thu thập dữ liệu LinkedIn năm 2026 mà không bị cấm: hướng dẫn và các loại proxy cần thiết

LinkedIn đã thắng kiện hiQ, đóng cửa Proxycurl và chặn bot ở cấp độ IP, dấu vân tay TLS và hành vi. Chúng ta sẽ phân tích từng bước cách thu thập dữ liệu công khai của LinkedIn một cách hợp pháp vào năm 2026, nơi nào là ranh giới pháp lý và proxy nào — proxy cư trú và di động — thực sự chịu được tải.

📅18 tháng 7, 2026
Cách thu thập dữ liệu LinkedIn năm 2026 mà không bị cấm: hướng dẫn và các loại proxy cần thiết

LinkedIn là nền tảng kín đáo nhất trong số các nền tảng lớn và đồng thời là nguồn dữ liệu B2B hấp dẫn nhất: hồ sơ chuyên gia, công ty, việc làm, thông tin chi tiết cho việc tạo khách hàng tiềm năng và tuyển dụng. Vào năm 2026, việc thu thập những dữ liệu này trở nên khó khăn và rủi ro hơn rõ rệt. LinkedIn đã thắng kiện hiQ Labs, kiện và đóng cửa dịch vụ thu thập dữ liệu lớn nhất Proxycurl, và ở cấp độ kỹ thuật, đã học cách lọc bot ngay cả trước khi bạn nhận được dòng HTML đầu tiên. Chúng ta sẽ phân tích từng bước cách thu thập dữ liệu công khai từ LinkedIn vào năm 2026, nơi ranh giới pháp lý và kỹ thuật nằm ở đâu và những proxy nào thực sự chịu được tải trọng.

Đối tượng và mục đích

Thu thập dữ liệu từ LinkedIn không phải là "hack xám", mà là công cụ làm việc cho những nhiệm vụ hoàn toàn hợp pháp: thu thập khách hàng tiềm năng cho bán hàng B2B, phân tích thị trường lao động và lương, giám sát đối thủ và việc tuyển dụng của họ, làm phong phú CRM, nghiên cứu ngành. Vấn đề là LinkedIn coi dữ liệu của mình như một tài sản và bảo vệ chúng mạnh mẽ hơn bất kỳ mạng xã hội nào khác. Do đó, trước khi gửi yêu cầu đầu tiên, bạn cần hiểu hai điều: bạn có thể thu thập gì theo luậttại sao mã thông thường lại gặp khó khăn chỉ sau năm phút.

Ranh giới pháp lý: những gì năm 2026 đã chỉ ra

Hiểu lầm lớn nhất là "dữ liệu công khai, có nghĩa là có thể thu thập tự do". Thực tiễn pháp lý trong những năm gần đây nói ngược lại.

Vụ kiện hiQ Labs chống lại LinkedIn đã lâu được coi là chiến thắng của những người thu thập dữ liệu: Tòa án phúc thẩm khu vực chín vào năm 2019 và 2022 đã chỉ ra rằng việc truy cập vào hồ sơ công khai không vi phạm luật chống hack CFAA. Nhưng vào tháng 11 năm 2022, cùng tòa án đã đứng về phía LinkedIn: lệnh cấm thu thập dữ liệu trong thỏa thuận người dùng được công nhận là có hiệu lực pháp lý như một nghĩa vụ hợp đồng. Vào ngày 7 tháng 12 năm 2022, các bên đã ghi nhận một thỏa thuận hòa giải - hiQ đã bị buộc phải trả 500.000 đô la (vi phạm hợp đồng cộng với CFAA do tài khoản giả) và bị áp đặt lệnh cấm vĩnh viễn với nghĩa vụ tiêu hủy toàn bộ mã và dữ liệu đã thu thập. Công ty hiQ đã ngừng hoạt động.

Vụ kiện thứ hai đáng chú ý là Proxycurl (công ty Nubela), API lớn nhất cho dữ liệu LinkedIn. Vào ngày 24 tháng 1 năm 2025, LinkedIn đã đệ đơn kiện liên bang chống lại nó tại Quận Bắc California với sáu lý do: vi phạm hợp đồng, gian lận, CFAA, luật cạnh tranh không lành mạnh của California và những lý do khác. Proxycurl bị cáo buộc đã tạo ra hàng trăm nghìn tài khoản giả để thu thập hàng triệu hồ sơ, bao gồm cả dữ liệu không công khai. Vụ việc đã được giải quyết vào giữa năm 2025: vào tháng 7, dịch vụ đã nói lời tạm biệt với khách hàng và đóng cửa. Người sáng lập đã viết rõ rằng doanh nghiệp mang lại khoảng 10 triệu đô la doanh thu, khoảng một nửa trong số đó đến từ việc thu thập dữ liệu LinkedIn, và "trong cuộc chiến này không thể thắng" chống lại một công ty có ngân sách pháp lý gần như không giới hạn. Điều kiện cấm cũng áp dụng cho khách hàng của Proxycurl.

Kết luận cho thực tiễn là rất cụ thể:

  • Không đăng nhập. Ngay khi bạn xác thực, bạn chấp nhận thỏa thuận người dùng, cấm bất kỳ việc thu thập tự động nào. Thu thập dữ liệu từ tài khoản là vi phạm hợp đồng trực tiếp, chính trên điều này LinkedIn thắng kiện.
  • Không sử dụng tài khoản giả. Cả hiQ và Proxycurl đều "chìm" vì số lượng hồ sơ giả - đây là một vi phạm riêng của CFAA.
  • Chỉ thu thập dữ liệu công khai và không cá nhân khi có thể. Ở đây có thêm GDPR: việc thu thập dữ liệu cá nhân ngay cả từ hồ sơ công khai mà không có cơ sở pháp lý ở EU được coi là vi phạm - logic này đã được cơ quan quản lý châu Âu xác nhận riêng, và chúng tôi đã phân tích chi tiết trong tài liệu về thu thập dữ liệu theo GDPR.

Nói đơn giản, proxy giải quyết vấn đề kỹ thuật về quyền truy cập, nhưng không cung cấp cơ sở pháp lý. Tuân thủ là ở cái gìtại sao bạn thu thập, chứ không phải qua IP nào.

Tại sao mã thông thường chết chỉ sau năm phút

LinkedIn đã xây dựng một lớp bảo vệ đa tầng, và việc hiểu cấu trúc của nó trực tiếp xác định những gì bạn sẽ cần.

Tường xác thực

Công khai, không cần đăng nhập, có thể truy cập hồ sơ cơ bản, trang tổng quan công ty, việc làm và tìm kiếm việc làm. Nhưng sau khi xem từ 3 đến 5 hồ sơ, LinkedIn sẽ hiển thị cửa sổ đăng nhập. Đây không phải là lỗi - đây là hàng rào đầu tiên: nền tảng cố ý hạn chế việc xem ẩn danh.

Phân tích hành vi

Lớp thứ hai theo dõi bạn di chuyển trên trang web: thời gian giữa các yêu cầu (con người không mở 100 hồ sơ trong một phút), mẫu điều hướng, chuyển động của chuột, chuỗi chuyển tiếp (referrer). Tất cả các tín hiệu được tổng hợp thành "điểm gian lận" và so sánh với hành vi điển hình của người dùng thực.

Nhận dạng dấu vân tay của yêu cầu

Lớp thứ ba - dấu vân tay của kết nối. LinkedIn phân tích chất lượng IP (có phải là từ mạng gia đình hay từ trung tâm dữ liệu), dấu vân tay TLS/JA3 của khách hàng, tiêu đề và cookie, siêu dữ liệu của thiết bị. Nếu dấu vân tay TLS cho thấy python-requests, chứ không phải Chrome thực sự, bạn sẽ bị phát hiện ngay lập tức - ngay cả qua proxy cư trú hoàn hảo.

Một dấu hiệu riêng biệt mà bạn sẽ gặp đầu tiên là HTTP-status 999. Đây là mã không chuẩn, duy nhất cho LinkedIn: nền tảng phản hồi với lưu lượng nghi ngờ như vậy. Nó được kích hoạt bởi User-Agent không phải trình duyệt (curl, python-requests, wget), tần suất yêu cầu cao từ một IP hoặc mạng, các dải trung tâm dữ liệu và đám mây, bỏ qua robots.txt. Nếu bạn nhận được 999 - hãy ngừng yêu cầu từ IP đó, chờ 30-60 giây và thử một proxy khác.

Cách thu thập dữ liệu từ LinkedIn vào năm 2026: từng bước

  1. Xác định điểm truy cập. Thu thập dữ liệu DOM HTML trên LinkedIn vào năm 2026 gần như không hoạt động - định dạng động và phức tạp. Dữ liệu được cung cấp qua các thẻ application/ld+json trên các trang hồ sơ, công ty và việc làm, cũng như qua các điểm cuối XHR nội bộ của phân trang (ví dụ: seeMoreJobPostings/search?start=25 với bước 25 kết quả). Nguồn "sống" chính là giao diện REST nội bộ của LinkedIn (Voyager API), cung cấp cho chính trang web. Quan trọng: API này không được tài liệu hóa, LinkedIn tích cực theo dõi nó để ngăn chặn lạm dụng và cấm tài khoản hoạt động qua Voyager trong vòng 3-7 ngày. Đó là lý do tại sao an toàn hơn khi chỉ giới hạn ở các trang công khai mà không cần xác thực.
  2. Bắt chước trình duyệt thực sự ở cấp độ TLS. Không đủ chỉ cần thay thế User-Agent của trình duyệt trong tiêu đề. Cần có một khách hàng với dấu vân tay TLS và HTTP/2 tương thích với Chrome: các thư viện như curl_cffi (impersonate), uTLS hoặc trình duyệt không đầu (Playwright/Puppeteer với cấu hình stealth). Proxy cư trú với dấu vân tay python-requests vẫn sẽ thất bại.
  3. Kết nối proxy đúng và xoay vòng theo phiên. Xoay vòng IP theo phiên, không phải theo mỗi yêu cầu, nếu bạn muốn giữ cookie phiên giữa các trang. Việc thay đổi IP thường xuyên trong một chuỗi logic sẽ trông đáng ngờ.
  4. Giữ nhịp độ giống con người. Vào năm 2026, ngưỡng an toàn là khoảng 20-30 yêu cầu đến hồ sơ từ một IP mỗi giờ; cao hơn - sẽ kích hoạt giới hạn tần suất. Đặt các khoảng dừng ngẫu nhiên giữa các yêu cầu (không cố định 1,5 giây cho tất cả), ngẫu nhiên hóa thứ tự và khoảng thời gian. Khoảng cách giữa các lần xem hồ sơ quan trọng hơn số lượng tổng cộng.
  5. Bắt đầu với mức độ song song nhỏ. Đừng khởi động 50 luồng cùng một lúc. Bắt đầu với 2-3 phiên đồng thời và tăng dần, theo dõi tỷ lệ phản hồi 999 và captcha.
  6. Xử lý các khối một cách thông minh. Nhận 999 và captcha như một tín hiệu, không phải lỗi: giảm tốc độ, thay đổi proxy, nghỉ ngơi. Ghi lại tỷ lệ thành công cho mỗi nhóm IP - qua đó có thể thấy khi nào nhóm "bị cháy".

Các cạm bẫy

  • Sự cám dỗ đăng nhập để có "dữ liệu đầy đủ". Tìm kiếm người, dữ liệu mở rộng của công ty và công cụ tuyển dụng chỉ có sẵn khi đăng nhập - nhưng chính việc đăng nhập biến việc thu thập thành vi phạm ToS và đặt tài khoản của bạn vào nguy cơ bị cấm trong 3-7 ngày. Hãy cân nhắc rủi ro một cách tỉnh táo.
  • Proxy từ trung tâm dữ liệu. LinkedIn duy trì danh sách chặn ASN của các nhà cung cấp dịch vụ lưu trữ và đánh dấu IP trung tâm dữ liệu mới trong vài phút. Đối với LinkedIn, đây gần như là một 999 đảm bảo.
  • Tài khoản giả. Về mặt kỹ thuật thì hấp dẫn, nhưng về mặt pháp lý - là con đường trực tiếp dẫn đến vụ kiện theo CFAA. Cả hai vụ kiện nổi bật vào năm 2022 và 2025 đều dựa vào điều này.
  • Dữ liệu cá nhân và GDPR. "Hồ sơ mở" không có nghĩa là "dữ liệu có thể được xử lý". Đối với khán giả từ EU, cần có cơ sở pháp lý bất kể proxy.
  • Proxy miễn phí. Các danh sách IP công khai đã lâu nằm trong danh sách đen của LinkedIn và thường bị xâm phạm - tiền và thời gian sẽ bị lãng phí.

Proxy nào cần cho LinkedIn - và tại sao

Loại proxy ở đây quyết định nhiều hơn cả mã của trình thu thập dữ liệu. Tình hình vào năm 2026 như sau:

  • Proxy từ trung tâm dữ liệu - không hoạt động. LinkedIn ngay lập tức nhận diện các ASN từ nhà cung cấp dịch vụ lưu trữ. Đối với nền tảng này, trung tâm dữ liệu gần như không còn khả thi, bất kể giá rẻ đến đâu.
  • Proxy cư trú - tối thiểu bắt buộc. Đây là IP của các nhà cung cấp internet thực tế: đối với hệ thống phát hiện, yêu cầu trông giống như từ một căn hộ bình thường. Proxy cư trú xoay vòng cung cấp tỷ lệ "giá cho mỗi yêu cầu thành công" tốt nhất và theo các đo lường ngành giữ 85-92% yêu cầu thành công. Đây là cơ sở để thu thập hồ sơ công khai và việc làm với quy mô lớn.
  • Proxy di động - loại tốt nhất cho LinkedIn. Proxy di động 4G/5G sử dụng IP của nhà điều hành qua CGNAT, chia sẻ giữa hàng ngàn người dùng thực. LinkedIn không thể cấm một IP như vậy mà không ảnh hưởng đến hàng triệu người dùng di động hợp pháp - do đó, địa chỉ di động cho nền tảng này gần như không thể phân biệt với lưu lượng sống. Chúng có giá cao hơn mỗi gigabyte, nhưng bù đắp cho các kịch bản nhạy cảm nhất và tốc độ cao.

Cặp đôi thực tiễn cho năm 2026: proxy cư trú cho khối lượng chính cộng với proxy di động cho các khu vực "nặng" và song song cao - và chắc chắn là trên dấu vân tay TLS tương thích với Chrome. Proxy không có dấu vân tay chính xác sẽ không cứu được, và dấu vân tay chính xác mà không có IP chất lượng sẽ gặp phải 999.

Kết luận

Thu thập dữ liệu từ LinkedIn vào năm 2026 không phải là "chỉ cần đặt requests và chạy". Nền tảng đã thắng các vụ kiện quan trọng, đóng cửa toàn bộ dịch vụ và chặn bot ở cấp độ IP, dấu vân tay TLS và hành vi. Chiến lược hiệu quả: chỉ thu thập dữ liệu công khai và không cần đăng nhập, không tạo ra tài khoản giả, giữ nhịp độ con người 20-30 yêu cầu trên IP mỗi giờ, bắt chước trình duyệt thực sự ở cấp độ TLS và dựa vào cơ sở hạ tầng proxy chất lượng - IP cư trú như cơ sở và di động như tăng cường. Giá trị đã chuyển từ mã sang lớp nhận diện: người thắng cuộc là người có IP sạch, không thể phân biệt với người dùng thực. Bạn có thể tìm kiếm proxy cư trú và di động phù hợp cho nhiệm vụ thu thập dữ liệu trong danh mục ProxyCove - với định vị địa lý và xoay vòng theo tốc độ cần thiết.