Volver al blog

Cómo extraer datos de LinkedIn en 2026 sin bloqueos: guía y proxies necesarios

LinkedIn ganó el juicio contra hiQ, cerró Proxycurl y está bloqueando bots a nivel de IP, huella TLS y comportamiento. Analizamos paso a paso cómo raspar datos públicos de LinkedIn legalmente en 2026, dónde se encuentra el límite legal y qué proxies — residenciales y móviles — realmente soportan la carga.

📅18 de julio de 2026
Cómo extraer datos de LinkedIn en 2026 sin bloqueos: guía y proxies necesarios
```html

LinkedIn es la plataforma más cerrada entre las grandes y, al mismo tiempo, la fuente más codiciada de datos B2B: perfiles de especialistas, empresas, vacantes, información para la generación de leads y reclutamiento. En 2026, recopilar estos datos se volvió notablemente más complicado y arriesgado. LinkedIn ganó un juicio contra hiQ Labs, demandó y cerró el mayor servicio de scraping Proxycurl, y a nivel técnico aprendió a filtrar bots incluso antes de que recibas la primera línea de HTML. Vamos a desglosar paso a paso cómo extraer datos públicos de LinkedIn en 2026, dónde se encuentra la frontera legal y técnica, y qué proxies realmente soportan la carga.

Para quién y por qué es necesario

El scraping de LinkedIn no es un "hack gris", sino una herramienta de trabajo para tareas completamente legales: recopilación de leads para ventas B2B, análisis del mercado laboral y salarios, monitoreo de competidores y sus contrataciones, enriquecimiento de CRM, investigación de industrias. El problema es que LinkedIn considera sus datos como un activo y los protege más agresivamente que cualquier otra red social. Por lo tanto, antes de enviar la primera solicitud, es necesario entender dos cosas: qué se puede recopilar legalmente y por qué el código común se encuentra con un muro en cinco minutos.

Frontera legal: lo que mostró el año 2026

El principal error es pensar que "los datos son públicos, por lo tanto, se pueden recoger libremente". La jurisprudencia de los últimos años dice exactamente lo contrario.

El caso hiQ Labs contra LinkedIn fue considerado durante mucho tiempo una victoria para los scrapers: el Tribunal de Apelaciones del Noveno Circuito en 2019 y 2022 indicó que el acceso a perfiles públicos no viola la ley anti-hacking CFAA. Pero en noviembre de 2022, el mismo tribunal, en esencia, se puso del lado de LinkedIn: la prohibición de scraping en el acuerdo de usuario fue reconocida legalmente como una obligación contractual. El 7 de diciembre de 2022, las partes firmaron un acuerdo de conciliación: se le exigió a hiQ el pago de 500,000 dólares (violación del contrato más CFAA debido a cuentas falsas) y se impuso una prohibición permanente con la obligación de destruir todo el código y los datos recopilados. La empresa hiQ dejó de existir.

El segundo caso ejemplar es Proxycurl (la empresa Nubela), la mayor API para datos de LinkedIn. El 24 de enero de 2025, LinkedIn presentó una demanda federal contra ella en el Distrito Norte de California por seis motivos: violación del contrato, fraude, CFAA, ley de competencia desleal de California y otros. Proxycurl fue acusada de crear cientos de miles de cuentas falsas para recopilar millones de perfiles, incluidos datos no públicos. El caso se resolvió a mediados de 2025: en julio, el servicio se despidió de sus clientes y cerró. El fundador escribió directamente que el negocio generaba alrededor de 10 millones de dólares en ingresos, aproximadamente la mitad provenía del scraping de LinkedIn, y que "no se puede ganar en esta lucha" contra una empresa con un presupuesto legal prácticamente ilimitado. Las condiciones de la prohibición también se aplicaron a los clientes de Proxycurl.

La conclusión para la práctica es extremadamente concreta:

  • No inicies sesión. Una vez que te autentiques, aceptas el acuerdo de usuario, que prohíbe cualquier recopilación automática. Hacer scraping desde una cuenta es una violación directa del contrato, y es precisamente en esto donde LinkedIn gana los juicios.
  • No uses cuentas falsas. Tanto hiQ como Proxycurl fueron "hundidas" precisamente por la masa de perfiles falsos; esto es una violación separada de la CFAA.
  • Recopila solo datos públicos y no personales donde sea posible. Aquí se añade el GDPR: la recopilación de datos personales incluso de perfiles abiertos sin una base legal en la UE se considera una violación; esta lógica ha sido establecida por el regulador europeo, y la hemos analizado en detalle en el material sobre scraping bajo GDPR.

En términos simples, los proxies resuelven la tarea técnica de acceso, pero no proporcionan una base legal. El cumplimiento está en qué y por qué recopilas, no en qué IP.

Por qué un script común muere en cinco minutos

LinkedIn ha construido una defensa en múltiples capas, y entender cómo funciona determina directamente lo que necesitarás.

Pared de autorización

Públicamente, sin iniciar sesión, están disponibles el perfil básico, la página de resumen de la empresa, las vacantes y la búsqueda de vacantes. Pero después de ver solo 3-5 perfiles, LinkedIn muestra una ventana de inicio de sesión. Esto no es un error: es la primera línea de defensa: la plataforma limita conscientemente la visualización anónima.

Análisis de comportamiento

La segunda capa rastrea cómo navegas por el sitio: los tiempos entre solicitudes (una persona no abre 100 perfiles por minuto), patrones de navegación, movimientos del mouse, cadena de referencias (referrer). Todas las señales se combinan en un "fraud score" y se comparan con el comportamiento típico de un usuario real.

Fingerprinting de la solicitud

La tercera capa es la huella de la conexión. LinkedIn analiza la calidad de la IP (residencial de una red doméstica o de un centro de datos), la huella TLS/JA3 del cliente, los encabezados y cookies, y los metadatos del dispositivo. Si la huella TLS muestra python-requests en lugar de un Chrome real, te detectan al instante, incluso a través de un proxy residencial perfecto.

Un marcador separado que encontrarás primero es el código de estado HTTP 999. Este es un código no estándar, único para LinkedIn: así responde la plataforma al tráfico sospechoso. Se provoca por User-Agents no navegadores (curl, python-requests, wget), alta frecuencia de solicitudes desde una IP o red, rangos de centros de datos y nubes, ignorando robots.txt. Si recibes un 999, detén las solicitudes desde esa IP, espera de 30 a 60 segundos y prueba con otro proxy.

Cómo hacer scraping en LinkedIn en 2026: paso a paso

  1. Determina tu punto de entrada. El DOM-scraping de HTML en LinkedIn en 2026 prácticamente no funciona: el marcado es dinámico y confuso. Los datos se entregan a través de etiquetas application/ld+json en las páginas de perfiles, empresas y vacantes, así como a través de endpoints internos de XHR de paginación (por ejemplo, seeMoreJobPostings/search?start=25 con un paso de 25 resultados). La principal fuente "viva" es la API REST interna de LinkedIn (Voyager API), que alimenta el propio sitio. Importante: esta API no está documentada, LinkedIn monitorea activamente su uso para detectar abusos y banea cuentas que operan a través de Voyager en 3-7 días. Por eso, es más seguro limitarse a páginas públicas sin autenticación.
  2. Finge un navegador real a nivel de TLS. No es suficiente con sustituir el User-Agent del navegador en los encabezados. Necesitas un cliente con una huella TLS y HTTP/2 compatible con Chrome: bibliotecas como curl_cffi (impersonate), uTLS o un navegador sin cabeza (Playwright/Puppeteer con configuración stealth). Un proxy residencial con huella python-requests aún fallará.
  3. Conecta proxies correctos y rota por sesión. Rota la IP por sesión, no por cada solicitud, si deseas mantener las cookies de sesión entre páginas. Cambiar frecuentemente la IP dentro de una misma cadena lógica se ve sospechoso.
  4. Mantén un ritmo humano. En 2026, el umbral seguro es de aproximadamente 20-30 solicitudes a perfiles desde una IP por hora; más de eso, se activa el rate limiting. Establece pausas aleatorias entre solicitudes (no fijas de 1.5 segundos para todo), aleatoriza el orden y los intervalos. El intervalo entre la visualización de perfiles es más importante que su número total.
  5. Comienza con poco paralelismo. No inicies 50 hilos de inmediato. Comienza con 2-3 sesiones simultáneas y aumenta, observando la proporción de respuestas 999 y captchas.
  6. Maneja bloqueos de manera adecuada. Captura 999 y captchas como señales, no como errores: reduce la velocidad, cambia proxies, haz una pausa. Registra la tasa de éxito por cada grupo de IP; esto te mostrará cuándo un grupo "se ha quemado".

Trampas

  • La tentación de iniciar sesión por datos "completos". La búsqueda de personas, datos ampliados de empresas y herramientas para reclutadores solo están disponibles bajo inicio de sesión, pero precisamente la autenticación convierte la recopilación en una violación de los Términos de Servicio y pone tu cuenta en riesgo de baneo en 3-7 días. Evalúa el riesgo con claridad.
  • Proxies de centros de datos. LinkedIn mantiene listas de bloqueo de ASN de proveedores de hosting y marca IP de centros de datos nuevos en minutos. Para LinkedIn, esto es casi un 999 garantizado.
  • Cuentas falsas. Técnicamente atractivo, legalmente es un camino directo a una demanda por CFAA. Ambos casos sonoros de 2022 y 2025 se basaron en esto.
  • Datos personales y GDPR. "El perfil está abierto" no significa "los datos se pueden procesar". Para la audiencia de la UE, se necesita una base legal independientemente del proxy.
  • Proxies gratuitos. Las listas públicas de IP ya están en las listas negras de LinkedIn y a menudo están comprometidas; es dinero y tiempo desperdiciado.

Qué proxies se necesitan para LinkedIn — y por qué

El tipo de proxy aquí es más decisivo que el propio código del scraper. La situación para 2026 es la siguiente:

  • Proxies de centros de datos — no funcionan. LinkedIn identifica instantáneamente los ASN de hosting. Para esta plataforma, el centro de datos queda prácticamente descartado, sin importar cuán barato sea.
  • Proxies residenciales — mínimo obligatorio. Estas son IP de proveedores de internet residenciales reales: para el sistema de detección, la solicitud parece provenir de un apartamento normal. Los proxies residenciales rotativos ofrecen la mejor relación "precio por solicitud exitosa" y, según mediciones de la industria, mantienen entre el 85% y el 92% de solicitudes exitosas. Esta es la base para la recopilación de perfiles públicos y vacantes a gran escala.
  • Proxies móviles — lo mejor para LinkedIn. Proxies móviles 4G/5G utilizan IP de operadores a través de CGNAT, que comparten miles de abonados reales. LinkedIn no puede banear tal IP sin afectar a una gran cantidad de usuarios móviles legítimos, por lo que las direcciones móviles para la plataforma son prácticamente indistinguibles del tráfico real. Son más caras por gigabyte, pero se amortizan en los escenarios más sensibles y a alta velocidad.

Una combinación práctica para 2026: proxies residenciales para el volumen principal más móviles para secciones "pesadas" y alto paralelismo — y siempre sobre una huella TLS compatible con Chrome. Proxies sin una huella correcta no ayudarán, y una huella correcta sin una IP de calidad se encontrará con un 999.

Conclusión

El scraping de LinkedIn en 2026 no se trata de "configurar requests y listo". La plataforma ha ganado juicios clave, cerrado servicios enteros y filtra bots a nivel de IP, huella TLS y comportamiento. Una estrategia efectiva: recopilar solo datos públicos y sin iniciar sesión, no crear cuentas falsas, mantener un ritmo humano de 20-30 solicitudes por IP por hora, fingir un navegador real a nivel de TLS y apoyarse en una infraestructura de proxies de calidad: IP residenciales como base y móviles como refuerzo. El valor se ha desplazado del código a la capa de identidad: gana quien tiene una IP limpia, indistinguible de un usuario real. Puedes encontrar proxies residenciales y móviles para tus necesidades de scraping en el catálogo de ProxyCove — con geo-targeting y rotación para el ritmo necesario.

```