返回博客

2026年如何在不被封禁的情况下解析LinkedIn:指南及所需代理

LinkedIn 赢得了对 hiQ 的诉讼,关闭了 Proxycurl,并在 IP、TLS 指纹和行为层面上阻止了机器人。我们逐步分析如何在 2026 年合法地抓取 LinkedIn 的公共数据,法律边界在哪里,以及哪些代理——居民代理和移动代理——真正能够承受负载。

📅2026年7月18日
2026年如何在不被封禁的情况下解析LinkedIn:指南及所需代理
```html

LinkedIn 是大型平台中最封闭的,同时也是最诱人的 B2B 数据来源:专业人士的个人资料、公司、职位空缺、潜在客户生成和招聘的见解。到 2026 年,收集这些数据变得明显更加困难和风险更大。LinkedIn 在与 hiQ Labs 的诉讼中获胜,起诉并关闭了最大的抓取服务 Proxycurl,并在技术层面上学会了在您获得第一行 HTML 之前就筛选掉机器人。我们逐步解析如何在 2026 年抓取 LinkedIn 的公开数据,法律和技术的界限在哪里,以及哪些代理能够真正承受负载。

这对谁有用以及为什么需要

抓取 LinkedIn 并不是“灰色黑客”,而是一个用于合法任务的有效工具:为 B2B 销售收集潜在客户、分析劳动市场和薪资、监控竞争对手及其招聘、丰富 CRM、研究行业。问题在于,LinkedIn 将其数据视为资产,并比任何其他社交网络更积极地保护它们。因此,在发送第一个请求之前,您需要理解两件事:根据法律可以收集什么为什么普通代码在五分钟内就会碰壁

法律界限:2026 年的启示

最大的误解是“数据是公开的,因此可以自由获取”。近年来的司法实践恰恰相反。

hiQ Labs 诉 LinkedIn 的案件长期以来被视为抓取者的胜利:第九巡回上诉法院在 2019 年和 2022 年指出,访问公开个人资料并不违反反黑客法 CFAA。但在 2022 年 11 月,同一法院实际上站在了 LinkedIn 一边:用户协议中的抓取禁令被认为是法律上有保障的合同义务。2022 年 12 月 7 日,双方达成和解——hiQ 被判赔偿 500,000 美元(因违反合同和由于虚假账户而违反 CFAA),并被施加永久禁令,要求销毁所有代码和收集的数据。hiQ 公司停止了运营。

第二个典型案例是 Proxycurl(Nubela 公司),这是最大的 LinkedIn 数据 API。2025 年 1 月 24 日,LinkedIn 在加利福尼亚北区对其提起了联邦诉讼,理由包括六项:违反合同、欺诈、CFAA、加利福尼亚不正当竞争法等。Proxycurl 被指控创建数十万个虚假账户以收集数百万个个人资料,包括非公开数据。此案在 2025 年中期达成和解:在 7 月,该服务与客户告别并关闭。创始人直言,该业务的收入约为 1000 万美元,其中大约一半来自 LinkedIn 的抓取,而“在与一家几乎没有法律预算限制的公司竞争中无法获胜”。禁令的条件也适用于 Proxycurl 的客户。

对实践的结论非常明确:

  • 不要登录。 一旦您授权,您就接受了禁止任何自动收集的用户协议。从账户抓取数据是直接违反合同的,正是在这一点上 LinkedIn 赢得了诉讼。
  • 绝对不要使用虚假账户。 hiQ 和 Proxycurl 的失败正是由于大量虚假个人资料——这本身就是违反 CFAA 的行为。
  • 仅在可能的情况下收集公开且非个人的数据。 此外,GDPR 也适用:在没有法律依据的情况下,即使是从公开个人资料中收集个人数据在欧盟也被视为违规——这一逻辑已被欧洲监管机构单独确认,我们在关于 GDPR 下的抓取 的材料中进行了详细讨论。

简单来说,代理解决了访问的技术问题,但并不提供法律依据。合规性在于您收集的 是什么为什么,而不是通过哪个 IP。

为什么普通脚本在五分钟内就会失败

LinkedIn 建立了多层保护,理解其结构直接决定了您需要什么。

授权墙

公开的、无需登录的内容包括基本个人资料、公司概览页面、职位空缺和职位搜索。但在查看 3-5 个个人资料后,LinkedIn 会显示登录窗口。这不是错误——这是第一道防线:平台故意限制匿名浏览。

行为分析

第二层监控您在网站上的行为:请求之间的时间间隔(人不会在一分钟内打开 100 个个人资料)、导航模式、鼠标移动、跳转链(referrer)。所有信号汇总为“欺诈评分”,并与真实用户的典型行为进行比较。

请求指纹

第三层是连接指纹。LinkedIn 分析 IP 的质量(家庭网络的居民 IP 或数据中心的托管 IP)、客户端的 TLS/JA3 指纹、头信息和 cookies、设备的元数据。如果 TLS 指纹显示 python-requests 而不是实际的 Chrome,您会立即被发现——即使通过完美的居民代理。

您首先会遇到的一个特殊标记是 HTTP 状态 999。这是一个非标准代码,LinkedIn 独有:该平台用它来响应可疑流量。它是由非浏览器的 User-Agent(curl、python-requests、wget)、来自同一 IP 或网络的高请求频率、数据中心和云范围、忽略 robots.txt 所引发的。如果收到 999——请停止从该 IP 的请求,等待 30-60 秒,然后尝试其他代理。

如何在 2026 年抓取 LinkedIn:逐步指南

  1. 确定入口点。 在 2026 年,LinkedIn 上的 DOM 抓取 HTML 几乎不起作用——标记是动态且复杂的。数据通过 application/ld+json 标签在个人资料、公司和职位页面上提供,以及通过内部 XHR 分页端点(例如,seeMoreJobPostings/search?start=25,步长为 25 个结果)。主要的“实时”来源是 LinkedIn 的内部 REST 接口(Voyager API),它为网站提供支持。重要的是:该 API 没有文档,LinkedIn 积极监控其滥用并 在 3-7 天内封禁通过 Voyager 工作的账户。因此,限制在没有授权的公开页面上进行操作是更安全的。
  2. 在 TLS 层面伪装真实浏览器。 仅在头信息中替换浏览器的 User-Agent 是不够的。需要一个具有 Chrome 兼容的 TLS 和 HTTP/2 指纹的客户端:像 curl_cffi(impersonate)、uTLS 或无头浏览器(Playwright/Puppeteer 与 stealth 配置)。带有 python-requests 指纹的居民代理仍然会失败。
  3. 连接正确的代理并在会话中轮换。 如果您希望在页面之间保持 cookie 会话,请在会话中 而不是每个请求 轮换 IP。频繁更换同一逻辑链中的 IP 看起来确实可疑。
  4. 保持人类的节奏。 在 2026 年,安全的阈值是每小时大约 20-30 个来自同一 IP 的请求;超过这个数量——就会启动速率限制。在请求之间设置随机暂停(而不是固定的 1.5 秒),随机化顺序和间隔。查看个人资料之间的间隔比它们的总数更重要。
  5. 从小规模并行开始。 不要一次启动 50 个线程。先从 2-3 个并发会话开始,逐步增加,观察 999 响应和验证码的比例。
  6. 妥善处理封锁。 将 999 和验证码视为信号,而不是错误:降低速度,切换代理,暂停。记录每个 IP 池的成功率——这可以显示何时池“失效”。

潜在陷阱

  • 诱惑登录以获取“完整”数据。 搜索人员、公司扩展数据和招聘工具仅在登录后可用——但登录会将收集转变为违反服务条款,并使您的账户在 3-7 天内面临封禁。要理性权衡风险。
  • 数据中心代理。 LinkedIn 保持托管提供商的 ASN 封锁列表,并在几分钟内标记新的数据中心 IP。对于 LinkedIn 来说,这几乎是保证的 999。
  • 虚假账户。 从技术上讲,这是诱人的,但在法律上——这是直接导致 CFAA 诉讼的途径。2022 年和 2025 年的两个引人注目的案件正是基于这一点。
  • 个人数据和 GDPR。 “个人资料公开”并不等于“数据可以处理”。对于来自欧盟的受众,必须有法律依据,无论代理如何。
  • 免费代理。 公开的 IP 列表早已被 LinkedIn 列入黑名单,并且经常被泄露——浪费金钱和时间。

LinkedIn 需要什么样的代理——以及为什么

在这里,代理的类型比抓取代码更为重要。2026 年的情况如下:

  • 数据中心代理——不适用。 LinkedIn 立即识别托管 ASN。对于这个平台,数据中心几乎完全不适用,无论它多么便宜。
  • 居民代理——最低要求。 这是来自真实家庭互联网服务提供商的 IP:对于检测系统,请求看起来就像来自普通公寓。轮换的 居民代理 提供了“每个成功请求的价格”最佳比例,并在行业测量中保持 85-92% 的成功访问。这是大规模收集公开个人资料和职位的基础。
  • 移动代理——LinkedIn 的最高级别。 移动 4G/5G 代理 使用运营商 IP 通过 CGNAT,这些 IP 共享数千个真实用户。LinkedIn 无法封禁这样的 IP,而不影响大量合法的移动用户——因此,移动地址对该平台几乎无法区分于真实流量。每千兆字节的费用更高,但在最敏感的场景和高频率下会得到回报。

2026 年的实用组合:居民代理用于主要流量,加上移动代理用于“重负载”区域和高并行性——并且一定要在 Chrome 兼容的 TLS 指纹之上。没有正确指纹的代理无法拯救您,而没有优质 IP 的正确指纹将会遭遇 999。

结论

在 2026 年抓取 LinkedIn 并不是“放置请求然后开始”。该平台赢得了关键诉讼,关闭了整个服务,并在 IP、TLS 指纹和行为层面上筛选掉机器人。有效的策略是:仅收集公开数据且不登录,不制造虚假账户,保持每小时每个 IP 20-30 个请求的人类节奏,在 TLS 层面伪装真实浏览器,并依赖高质量的代理基础设施——居民 IP 作为基础,移动 IP 作为增强。价值已从代码转移到承载身份的层面:胜利者是拥有干净、无法与真实用户区分的 IP 的人。可以在 ProxyCove 目录 中找到适合抓取任务的居民和移动代理——带有地理定位和根据所需速度进行轮换。

```