LinkedInは、主要なプラットフォームの中で最も閉鎖的であり、同時にB2Bデータの最も魅力的なソースです:専門家のプロフィール、企業、求人、リード生成や採用のためのインサイト。2026年には、これらのデータを収集することが明らかに難しく、リスクが高くなりました。LinkedInはhiQ Labsに対して訴訟に勝利し、最大のスクレイピングサービスであるProxycurlを訴え、閉鎖しました。また、技術的なレベルでは、最初のHTML行を受け取る前にボットを排除する方法を学びました。2026年にLinkedInの公開データをパースする方法、法的および技術的な境界がどこにあるのか、そしてどのプロキシが実際に負荷に耐えられるのかを段階的に解説します。
誰のために、何のために必要か
LinkedInのスクレイピングは「グレーなハック」ではなく、完全に合法的なタスクのための作業ツールです:B2B販売のリード収集、労働市場と給与の分析、競合他社のモニタリングと採用、CRMの強化、業界の調査。問題は、LinkedInが自社のデータを資産として扱い、他のソーシャルネットワークよりも積極的に保護していることです。したがって、最初のリクエストを書く前に、次の2つのことを理解する必要があります:法律に基づいて何を収集できるかとなぜ通常のコードが5分で壁にぶつかるのかです。
法的境界:2026年が示したこと
最大の誤解は「データは公開されているので、自由に取得できる」というものです。最近の裁判の実績は、まさにその逆を示しています。
hiQ Labs対LinkedInの事件は、長い間スクレイパーの勝利と見なされていました:2019年と2022年に第9巡回控訴裁判所は、公開プロフィールへのアクセスがCFAA(コンピュータ詐欺および乱用法)を違反しないと指摘しました。しかし、2022年11月、同じ裁判所は実質的にLinkedInの側に立ちました:ユーザー契約におけるスクレイピングの禁止は、契約上の義務として法的に保証されると認められました。2022年12月7日、当事者は和解を記録しました — hiQは50万ドルを賠償し(契約違反および偽アカウントによるCFAA)、全てのコードと収集したデータを破棄する義務が課されました。hiQはその後、存在を停止しました。
もう一つの示唆に富んだケースはProxycurl(Nubela社)で、LinkedInデータの最大のAPIです。2025年1月24日、LinkedInはカリフォルニア北部地区で、契約違反、詐欺、CFAA、カリフォルニア州の不正競争防止法など、6つの理由で彼に対して連邦訴訟を提起しました。Proxycurlは、数十万の偽アカウントを作成して数百万のプロフィールを収集したとして非難されました。2025年の中頃にこの事件は和解され、7月にサービスは顧客と別れ、閉鎖されました。創業者は、ビジネスが約1000万ドルの収益を上げており、その半分がLinkedInのスクレイピングから来ていると明言し、「この戦いでは勝てない」と述べました。禁止条件はProxycurlの顧客にも適用されました。
実務における結論は非常に具体的です:
- ログインしないでください。 一度認証されると、あなたは自動収集を禁止するユーザー契約に同意することになります。アカウントからのスクレイピングは契約違反であり、LinkedInが裁判に勝つ理由です。
- 偽アカウントは作成しないでください。 hiQもProxycurlも、まさに大量の偽プロフィールによって「沈没」しました — これはCFAAの別の違反です。
- 可能な限り公開されている非個人データのみを収集してください。 ここにGDPRが追加されます:EUでは、法的根拠なしに公開プロフィールから個人データを収集することは違反と見なされます — この論理は欧州の規制当局によって明確にされ、私たちはそれをGDPRに基づくスクレイピングに関する資料で詳しく説明しました。
簡単に言えば、プロキシはアクセスの技術的な問題を解決しますが、法的根拠を提供しません。コンプライアンスは、何をおよびなぜ収集するかにあり、どのIPを通じて行うかにはありません。
なぜ通常のスクリプトは5分で死ぬのか
LinkedInは多層的な保護を構築しており、その構造を理解することが、あなたに必要なものを直接決定します。
認証の壁
公開されている情報として、ログインなしでアクセスできるのは基本プロフィール、企業の概要ページ、求人情報、求人検索です。しかし、3〜5のプロフィールを閲覧した後、LinkedInはログインウィンドウを表示します。これはバグではなく、最初の防衛線です:プラットフォームは意図的に匿名の閲覧を制限しています。
行動分析
第二の層は、あなたがサイトをどのように移動するかを追跡します:リクエスト間のタイミング(人は1分間に100のプロフィールを開くことはありません)、ナビゲーションパターン、マウスの動き、遷移のチェーン(リファラー)。すべての信号は「詐欺スコア」に集約され、生きたユーザーの典型的な行動と比較されます。
リクエストのフィンガープリンティング
第三の層は接続のフィンガープリンティングです。LinkedInはIPの質(家庭のネットワークからの居住者か、ホスティングからのデータセンターか)、TLS/JA3フィンガープリント、ヘッダーとクッキー、デバイスのメタデータを分析します。TLSフィンガープリンティングがpython-requestsを示す場合、実際のChromeではないため、あなたは瞬時に見つかります — 完璧な居住者プロキシを通してもです。
最初に遭遇する特別なマーカーはHTTPステータス999です。これはLinkedIn独自の非標準コードであり、プラットフォームが疑わしいトラフィックに応答する方法です。これは、ブラウザ以外のUser-Agent(curl、python-requests、wget)、単一のIPまたはネットワークからの高頻度のリクエスト、データセンターおよびクラウド範囲、robots.txtの無視によって引き起こされます。999を受け取った場合、そのIPからのリクエストを中止し、30〜60秒待って別のプロキシを試してください。
2026年にLinkedInをパースする方法:ステップバイステップ
- エントリーポイントを決定してください。 2026年のLinkedInでのDOMスクレイピングはほとんど機能しません — マークアップは動的で複雑です。データは、プロフィール、企業、求人ページの
application/ld+jsonタグを通じて提供され、ページネーションの内部XHRエンドポイント(例えば、seeMoreJobPostings/search?start=25、25件の結果ごとに)を通じても提供されます。主な「生」の情報源は、LinkedInの内部RESTインターフェース(Voyager API)であり、これはサイト自体に供給されています。重要なのは、このAPIは文書化されておらず、LinkedInは悪用を監視し、Voyagerを通じて動作するアカウントを3〜7日で禁止することです。したがって、認証なしの公開ページに制限する方が安全です。 - TLSレベルで本物のブラウザを偽装してください。 ヘッダーにブラウザのUser-Agentを設定するだけでは不十分です。Chrome互換のTLSおよびHTTP/2フィンガープリンティングを持つクライアントが必要です:
curl_cffi(impersonate)、uTLS、またはヘッドレスブラウザ(Playwright/Puppeteerのステルス設定)などのライブラリです。python-requestsのフィンガープリンティングを持つ居住者プロキシは、依然として失敗します。 - 適切なプロキシを接続し、セッションごとにローテーションしてください。 クッキーセッションをページ間で保持したい場合は、各リクエストではなくセッションごとにIPをローテーションする必要があります。1つの論理チェーン内でのIPの頻繁な変更は、疑わしく見えます。
- 人間のペースを維持してください。 2026年の安全な閾値は、1時間あたり約20〜30のプロフィールリクエストです。それを超えると、レート制限がかかります。リクエスト間にランダムな間隔を設定し(すべてに固定の1.5秒ではなく)、順序や間隔をランダム化してください。プロフィールの閲覧間の間隔は、総数よりも重要です。
- 小規模な並列処理から始めてください。 50のスレッドを同時に開始しないでください。2〜3の同時セッションから始め、999応答やCAPTCHAの割合を観察しながら増やしてください。
- ブロックを適切に処理してください。 999やCAPTCHAを信号として捉え、エラーとしてではなく、ペースを落とし、プロキシを変更し、休憩を取ってください。各IPプールの成功率をログに記録してください — それによってプールが「枯渇」した時期がわかります。
落とし穴
- 「完全な」データのためにログインする誘惑。 人々の検索、企業の拡張データ、リクルーター用ツールはログインして初めてアクセス可能ですが、ログインすると収集がToS違反となり、アカウントが3〜7日で禁止されるリスクがあります。リスクを冷静に評価してください。
- データセンターのプロキシ。 LinkedInはホスティングプロバイダーのASNのブロックリストを保持し、新しいデータセンターのIPを数分でマークします。LinkedInにとって、これはほぼ確実に999です。
- 偽アカウント。 技術的には魅力的ですが、法的にはCFAAによる訴訟への直接的な道です。2022年と2025年の両方の注目すべき事件は、これに基づいていました。
- 個人データとGDPR。 「プロフィールが公開されている」ことは「データを処理できる」ことを意味しません。EUのオーディエンスに対しては、プロキシに関係なく法的根拠が必要です。
- 無料のプロキシ。 公開されたIPリストはすでにLinkedInのブラックリストに載っており、しばしば侵害されています — お金と時間の無駄です。
LinkedInに必要なプロキシ — その理由
ここでのプロキシの種類は、スクレイパーのコード自体よりも重要です。2026年の状況は次のとおりです:
- データセンター — 機能しません。 LinkedInはホスティングASNを瞬時に認識します。このプラットフォームにとって、データセンターはほぼ完全に除外されます。
- 居住者 — 必須の最低限。 これは実際の家庭のインターネットプロバイダーからのIPです:検出システムにとって、リクエストは普通のアパートからのもののように見えます。回転する居住者プロキシは、「成功したリクエストの価格」において最良の比率を提供し、業界の測定において85〜92%の成功率を維持します。これは公開プロフィールと求人を大量に収集するための基盤です。
- モバイル — LinkedInのための最高級。 モバイル4G/5Gプロキシは、CGNATの下でオペレーターのIPを使用し、数千の実際の加入者を共有します。LinkedInは、そのようなIPを禁止することはできず、多くの正当なモバイルユーザーに影響を与えずに済むため、モバイルアドレスはプラットフォームにとってほぼ生のトラフィックと区別がつきません。ギガバイトあたりのコストは高いですが、最も敏感なシナリオや高いペースでの収益を上げます。
2026年の実用的な組み合わせ:主要なボリュームには居住者プロキシを使用し、「重い」セクションや高い並列処理にはモバイルプロキシを使用し、必ずChrome互換のTLSフィンガープリンティングの上に構築してください。正しいフィンガープリンティングを持たないプロキシは救えず、質の高いIPがない正しいフィンガープリンティングは999にぶつかります。
結論
2026年のLinkedInのパースは、「リクエストを設定して進む」ことではありません。プラットフォームは重要な裁判に勝ち、サービスを閉鎖し、IP、TLSフィンガープリンティング、行動のレベルでボットを排除しています。機能する戦略は、ログインなしで公開されているものだけを収集し、偽アカウントを作成せず、1時間あたり20〜30リクエストの人間のペースを維持し、TLSレベルで本物のブラウザを偽装し、質の高いプロキシインフラストラクチャに依存することです — 居住者IPを基盤として、モバイルを強化として使用します。価値はコードからアイデンティティの担い手に移行しました:生きたユーザーと区別がつかないクリーンなIPを持つ者が勝ちます。スクレイピングのニーズに合わせて居住者およびモバイルプロキシを選定するには、ProxyCoveのカタログを参照してください — 地理ターゲティングと必要なペースに応じたローテーションが可能です。
