LinkedIn은 대규모 플랫폼 중 가장 폐쇄적이면서 동시에 B2B 데이터의 가장 매력적인 출처입니다: 전문가 프로필, 회사, 채용 공고, 리드 생성 및 채용을 위한 인사이트. 2026년에는 이러한 데이터를 수집하는 것이 눈에 띄게 더 어려워지고 위험해졌습니다. LinkedIn은 hiQ Labs를 상대로 소송에서 승리하고, 최대 스크래핑 서비스인 Proxycurl을 고소하여 폐쇄했으며, 기술적으로는 첫 번째 HTML 줄을 받기 전에 봇을 걸러내는 방법을 배웠습니다. 2026년에 LinkedIn의 공개 데이터를 파싱하는 방법, 법적 및 기술적 경계가 어디에 있는지, 어떤 프록시가 실제로 부하를 견딜 수 있는지 단계별로 살펴보겠습니다.
누구를 위한 것이며 왜 필요한가
LinkedIn 스크래핑은 "회색 해킹"이 아니라 합법적인 작업을 위한 도구입니다: B2B 판매를 위한 리드 수집, 노동 시장 및 급여 분석, 경쟁사 및 그들의 채용 모니터링, CRM 보강, 산업 연구. 문제는 LinkedIn이 자신의 데이터를 자산으로 간주하고 다른 소셜 네트워크보다 더 공격적으로 보호한다는 것입니다. 따라서 첫 번째 요청을 작성하기 전에 두 가지를 이해해야 합니다: 법적으로 무엇을 수집할 수 있는지와 일반 코드가 5분 만에 벽에 부딪히는 이유입니다.
법적 경계: 2026년이 보여준 것
주요 오해는 "데이터가 공개되었으니 자유롭게 가져갈 수 있다"는 것입니다. 최근 몇 년간의 판례는 정반대를 말하고 있습니다.
hiQ Labs 대 LinkedIn 사건은 오랫동안 스크래퍼의 승리로 여겨졌습니다: 2019년과 2022년 제9순회 항소법원은 공개 프로필에 대한 접근이 CFAA의 해킹 방지법을 위반하지 않는다고 밝혔습니다. 그러나 2022년 11월, 같은 법원은 본질적으로 LinkedIn의 편에 섰습니다: 사용자 계약서에 명시된 스크래핑 금지는 법적으로 보장된 계약 의무로 인정되었습니다. 2022년 12월 7일, 양측은 합의에 도달했습니다 — hiQ는 500,000달러를 지불해야 했으며(계약 위반 및 가짜 계정으로 인한 CFAA 위반) 모든 코드와 수집된 데이터를 파기해야 하는 영구 금지 명령이 내려졌습니다. hiQ는 존재를 중단했습니다.
두 번째 주목할 만한 사례는 Proxycurl (Nubela 회사)로, LinkedIn 데이터에 대한 최대 API입니다. 2025년 1월 24일, LinkedIn은 계약 위반, 사기, CFAA, 캘리포니아의 불공정 경쟁법 등 여섯 가지 이유로 그에 대해 연방 소송을 제기했습니다. Proxycurl은 수백만 개의 프로필을 수집하기 위해 수십만 개의 가짜 계정을 생성한 혐의를 받았습니다. 이 사건은 2025년 중반에 해결되었습니다: 7월에 이 서비스는 고객들과 작별하고 폐쇄되었습니다. 창립자는 비즈니스가 약 1,000만 달러의 수익을 올렸으며, 그 중 절반 정도가 LinkedIn 스크래핑에서 나왔다고 명시했습니다. 그는 "이 싸움에서 이길 수 없다"고 말했습니다. 금지 조건은 Proxycurl의 고객에게도 적용되었습니다.
실무를 위한 결론은 매우 구체적입니다:
- 로그인하지 마십시오. 로그인하는 순간, 자동 수집을 금지하는 사용자 계약을 수락하게 됩니다. 계정에서 스크래핑하는 것은 계약 위반으로, LinkedIn이 소송에서 승리하는 이유입니다.
- 가짜 계정을 만들지 마십시오. hiQ와 Proxycurl 모두 가짜 프로필의 대량 생성으로 "침몰"했습니다 — 이는 CFAA의 별도 위반입니다.
- 가능한 한 공개적이고 비개인적인 데이터만 수집하십시오. 여기에는 GDPR이 추가됩니다: 법적 근거 없이 공개 프로필에서 개인 데이터를 수집하는 것은 EU에서 위반으로 간주됩니다 — 이 논리는 유럽 규제 기관에 의해 별도로 확립되었으며, 우리는 GDPR에 따른 스크래핑에 대한 자료에서 자세히 설명했습니다.
간단히 말해, 프록시는 접근이라는 기술적 문제를 해결하지만 법적 근거를 제공하지는 않습니다. 컴플라이언스는 무엇을 그리고 왜 수집하는지에 달려 있으며, 어떤 IP를 통해서가 아닙니다.
왜 일반 스크립트가 5분 만에 죽는가
LinkedIn은 다층 보호를 구축했으며, 그 구조를 이해하는 것이 필요한 것을 직접적으로 결정합니다.
인증의 벽
공식적으로 로그인 없이 접근할 수 있는 것은 기본 프로필, 회사 개요 페이지, 채용 공고 및 채용 검색입니다. 그러나 3~5개의 프로필을 본 후 LinkedIn은 로그인 창을 표시합니다. 이는 버그가 아니라 첫 번째 방어선입니다: 플랫폼은 의도적으로 익명 검색을 제한합니다.
행동 분석
두 번째 층은 사용자가 사이트를 탐색하는 방식을 추적합니다: 요청 간의 타이밍(사람은 1분에 100개의 프로필을 열지 않음), 탐색 패턴, 마우스 움직임, 전환 체인(referrer). 모든 신호는 "사기 점수"로 집계되어 일반 사용자의 행동과 비교됩니다.
요청의 핑거프린팅
세 번째 층은 연결의 지문입니다. LinkedIn은 IP의 품질(자택 네트워크의 거주자 IP 또는 호스팅의 데이터 센터 IP), TLS/JA3 클라이언트 지문, 헤더 및 쿠키, 장치 메타데이터를 분석합니다. TLS 지문이 python-requests를 나타내면, 진짜 Chrome이 아닐 경우 즉시 감지됩니다 — 심지어 완벽한 거주자 프록시를 사용하더라도 말입니다.
당신이 처음 마주칠 특정 마커는 HTTP 상태 999입니다. 이는 LinkedIn에 고유한 비표준 코드로, 플랫폼이 의심스러운 트래픽에 응답하는 방식입니다. 이는 비브라우저 User-Agent(curl, python-requests, wget), 하나의 IP 또는 네트워크에서 높은 요청 빈도, 데이터 센터 및 클라우드 범위, robots.txt 무시로 인해 유발됩니다. 999를 받으면 — 이 IP에서 요청을 중단하고 30~60초 기다린 후 다른 프록시를 시도하십시오.
2026년에 LinkedIn을 파싱하는 방법: 단계별
- 진입점을 결정하십시오. 2026년 LinkedIn에서 HTML의 DOM 스크래핑은 거의 작동하지 않습니다 — 마크업이 동적이고 복잡합니다. 데이터는 프로필, 회사 및 채용 페이지의
application/ld+json태그를 통해 제공되며, 내부 XHR 페이징 엔드포인트를 통해 제공됩니다(예:seeMoreJobPostings/search?start=25는 25개의 결과 단위로). 주요 "실시간" 출처는 LinkedIn의 내부 REST 인터페이스(Voyager API)입니다. 이 API는 문서화되어 있지 않으며, LinkedIn은 남용을 모니터링하고 Voyager를 통해 작동하는 계정을 3~7일 이내에 차단합니다. 따라서 인증 없이 공개 페이지에 국한하는 것이 더 안전합니다. - TLS 수준에서 진짜 브라우저를 가장하십시오. 브라우저 User-Agent를 헤더에 설정하는 것만으로는 충분하지 않습니다. Chrome 호환 TLS 및 HTTP/2 지문을 가진 클라이언트가 필요합니다:
curl_cffi(impersonate),uTLS또는 stealth 구성의 headless 브라우저(Playwright/Puppeteer).python-requests지문을 가진 거주자 프록시는 여전히 실패할 것입니다. - 올바른 프록시를 연결하고 세션에 따라 회전하십시오. 쿠키 세션을 페이지 간에 유지하려면 각 요청이 아니라 세션에 따라 IP를 회전하십시오. 하나의 논리적 체인 내에서 IP를 자주 변경하는 것은 의심스러워 보입니다.
- 인간의 속도를 유지하십시오. 2026년 안전한 한계는 한 IP에서 시간당 약 20~30개의 프로필 요청입니다; 이를 초과하면 속도 제한이 활성화됩니다. 요청 간에 무작위로 지연을 설정하고(모든 요청에 대해 고정된 1.5초가 아님), 순서와 간격을 무작위화하십시오. 프로필을 보는 간격이 총 수보다 더 중요합니다.
- 작은 병렬성으로 시작하십시오. 한 번에 50개의 스레드를 실행하지 마십시오. 2~3개의 동시 세션으로 시작하고, 999 응답 및 CAPTCHA 비율을 관찰하면서 늘려가십시오.
- 차단을 적절하게 처리하십시오. 999 및 CAPTCHA를 신호로 인식하고 오류로 보지 마십시오: 속도를 줄이고, 프록시를 변경하고, 일시 중지하십시오. 각 IP 풀에 대한 성공률을 기록하십시오 — 이를 통해 풀이 "타버린" 시점을 알 수 있습니다.
주의할 점
- "완전한" 데이터를 위해 인증할 유혹. 사람 검색, 회사의 확장된 데이터 및 채용 도구는 로그인해야만 접근할 수 있습니다 — 그러나 로그인은 수집을 서비스 약관 위반으로 변환하고 귀하의 계정을 3~7일 이내에 차단할 위험에 처하게 합니다. 위험을 신중하게 평가하십시오.
- 데이터 센터 프록시. LinkedIn은 호스팅 제공자의 ASN 블랙리스트를 유지하고 있으며, 새로운 데이터 센터 IP를 몇 분 만에 표시합니다. LinkedIn에 대해서는 거의 보장된 999입니다.
- 가짜 계정. 기술적으로 유혹적이지만, 법적으로는 CFAA 소송으로 가는 직접적인 길입니다. 2022년과 2025년의 두 가지 유명한 사건은 이 문제에 기반하고 있었습니다.
- 개인 데이터 및 GDPR. "프로필이 공개됨"은 "데이터를 처리할 수 있다"는 의미가 아닙니다. EU 청중을 위해서는 프록시와 관계없이 법적 근거가 필요합니다.
- 무료 프록시. 공개 IP 목록은 오래전에 LinkedIn의 블랙리스트에 올라 있으며, 종종 손상되었습니다 — 시간과 돈이 낭비됩니다.
LinkedIn에 필요한 프록시는 무엇이며 그 이유는 무엇인가
여기서 프록시 유형은 스크래퍼 코드보다 더 중요합니다. 2026년의 상황은 다음과 같습니다:
- 데이터 센터 — 작동하지 않음. LinkedIn은 호스팅 ASN을 즉시 인식합니다. 이 플랫폼에 대해 데이터 센터는 거의 완전히 제외됩니다, 아무리 저렴하더라도.
- 거주자 — 필수 최소. 이는 실제 가정 인터넷 제공자의 IP입니다: 시스템 감지에서 요청은 일반 아파트에서 온 것처럼 보입니다. 회전하는 거주자 프록시는 "성공적인 요청에 대한 가격" 비율이 가장 좋으며, 산업 측정에서 85~92%의 성공적인 접근을 유지합니다. 이는 공개 프로필 및 채용 공고를 대량으로 수집하기 위한 기반입니다.
- 모바일 — LinkedIn을 위한 최고급. 모바일 4G/5G 프록시는 CGNAT를 통해 운영자 IP를 사용하며, 이는 수천 명의 실제 가입자와 공유됩니다. LinkedIn은 이러한 IP를 차단할 수 없으며, 많은 합법적인 모바일 사용자를 해치지 않고는 불가능합니다 — 따라서 모바일 주소는 플랫폼에서 실제 트래픽과 거의 구별할 수 없습니다. 기가바이트당 비용이 더 비싸지만, 가장 민감한 시나리오와 높은 속도에서 수익을 올립니다.
2026년의 실용적인 조합: 기본 볼륨을 위한 거주자 프록시와 "무거운" 구역 및 높은 병렬성을 위한 모바일 프록시 — 그리고 반드시 Chrome 호환 TLS 지문 위에. 올바른 지문이 없는 프록시는 도움이 되지 않으며, 올바른 지문이 없는 품질 IP는 999에 부딪힐 것입니다.
결론
2026년에 LinkedIn을 파싱하는 것은 "requests를 설정하고 시작하는 것"이 아닙니다. 플랫폼은 주요 소송에서 승리하고, целые 서비스들을 폐쇄했으며, IP, TLS 지문 및 행동 수준에서 봇을 차단합니다. 작동하는 전략: 로그인 없이 공개 데이터만 수집하고, 가짜 계정을 생성하지 않으며, IP당 시간당 20~30개의 요청으로 인간의 속도를 유지하고, TLS 수준에서 진짜 브라우저를 가장하고, 품질 프록시 인프라에 의존하는 것입니다 — 거주자 IP를 기본으로 하고 모바일 IP를 보강으로 사용합니다. 가치가 코드에서 사용자와 구별할 수 없는 깨끗한 IP로 이동했습니다. 스크래핑 작업에 맞는 거주자 및 모바일 프록시를 ProxyCove 카탈로그에서 선택할 수 있습니다 — 지리적 타겟팅 및 필요한 속도에 따라 회전합니다.
```