← Zurück zum Blog

LinkedIn 2026 ohne Sperren parsen: Leitfaden und benötigte Proxys

LinkedIn hat den Prozess gegen hiQ gewonnen, hat Proxycurl geschlossen und schneidet Bots auf IP-, TLS-Fingerabdruck- und Verhaltensniveau ab. Wir analysieren Schritt für Schritt, wie man 2026 legal öffentliche Daten von LinkedIn parsen kann, wo die rechtliche Grenze verläuft und welche Proxys - residente und mobile - tatsächlich die Last tragen.

📅18. Juli 2026
LinkedIn 2026 ohne Sperren parsen: Leitfaden und benötigte Proxys

LinkedIn ist die am stärksten geschützte der großen Plattformen und gleichzeitig die verlockendste Quelle für B2B-Daten: Profile von Fachleuten, Unternehmen, Stellenangebote, Einblicke für die Lead-Generierung und Rekrutierung. Im Jahr 2026 wurde das Sammeln dieser Daten deutlich schwieriger und riskanter. LinkedIn gewann einen Rechtsstreit gegen hiQ Labs, verklagte und schloss den größten Scraping-Dienst Proxycurl, und auf technischer Ebene lernte es, Bots bereits zu filtern, bevor Sie die erste Zeile HTML erhalten. Lassen Sie uns Schritt für Schritt durchgehen, wie man öffentliche Daten von LinkedIn im Jahr 2026 parst, wo die rechtliche und technische Grenze verläuft und welche Proxys tatsächlich die Last tragen.

Für wen und warum das notwendig ist

Scraping von LinkedIn ist kein „grauer Hack“, sondern ein funktionales Werkzeug für durchaus legale Aufgaben: Lead-Generierung für B2B-Verkäufe, Analyse des Arbeitsmarktes und der Gehälter, Überwachung von Wettbewerbern und deren Einstellungen, Anreicherung von CRM, Branchenforschung. Das Problem ist, dass LinkedIn seine Daten als Vermögenswert betrachtet und sie aggressiver schützt als jede andere Social Media Plattform. Daher ist es wichtig, vor dem ersten Anfrage zu verstehen, zwei Dinge: was man gesetzlich sammeln darf und warum gewöhnlicher Code nach fünf Minuten an die Wand stößt.

Rechtliche Grenze: Was das Jahr 2026 gezeigt hat

Die größte Fehlannahme ist: „Die Daten sind öffentlich, also kann man sie frei abholen“. Die Rechtsprechung der letzten Jahre sagt genau das Gegenteil.

Der Fall hiQ Labs gegen LinkedIn wurde lange als Sieg für Scraper angesehen: Das Berufungsgericht des neunten Bezirks stellte 2019 und 2022 fest, dass der Zugang zu öffentlich zugänglichen Profilen das Anti-Hacking-Gesetz CFAA nicht verletzt. Aber im November 2022 stellte dasselbe Gericht im Wesentlichen auf die Seite von LinkedIn: Das Verbot des Scraping in den Nutzungsbedingungen wurde als rechtlich durchsetzbar anerkannt. Am 7. Dezember 2022 einigten sich die Parteien auf einen Vergleich — hiQ musste 500.000 Dollar zahlen (Vertragsverletzung plus CFAA wegen gefälschter Konten) und erhielt ein dauerhaftes Verbot mit der Verpflichtung, gesamten Code und gesammelte Daten zu vernichten. Die Firma hiQ stellte ihre Existenz ein.

Ein weiterer aufschlussreicher Fall ist Proxycurl (Firma Nubela), die größte API für LinkedIn-Daten. Am 24. Januar 2025 reichte LinkedIn gegen sie eine Bundesklage im nördlichen Bezirk Kalifornien aus sechs Gründen ein: Vertragsverletzung, Betrug, CFAA, kalifornisches Gesetz über unlauteren Wettbewerb und andere. Proxycurl wurde beschuldigt, Hunderttausende gefälschter Konten erstellt zu haben, um Millionen von Profilen zu sammeln, einschließlich nicht öffentlicher Daten. Der Fall wurde Mitte 2025 beigelegt: Im Juli verabschiedete sich der Dienst von seinen Kunden und stellte den Betrieb ein. Der Gründer schrieb direkt, dass das Geschäft etwa 10 Millionen Dollar Umsatz brachte, etwa die Hälfte davon stammte aus dem Scraping von LinkedIn, und „in diesem Kampf kann man nicht gewinnen“ gegen ein Unternehmen mit praktisch unbegrenztem rechtlichen Budget. Die Bedingungen des Verbots galten auch für die Kunden von Proxycurl.

Die Schlussfolgerung für die Praxis ist äußerst konkret:

  • Loggen Sie sich nicht ein. Sobald Sie sich anmelden, akzeptieren Sie die Nutzungsbedingungen, die jegliches automatisierte Sammeln verbieten. Scraping von einem Konto ist ein direkter Vertragsbruch, auf dem LinkedIn die Gerichtsverfahren gewinnt.
  • Keine gefälschten Konten. Sowohl hiQ als auch Proxycurl wurden genau durch die Masse gefälschter Profile „untergegangen“ — das ist ein separates Vergehen gegen CFAA.
  • Sammlung nur von öffentlich zugänglichen und nicht personenbezogenen Daten, wo es möglich ist. Hier kommt die DSGVO ins Spiel: Das Sammeln personenbezogener Daten sogar aus offenen Profilen ohne rechtliche Grundlage in der EU wird als Verstoß angesehen — diese Logik hat der europäische Regulierer separat festgelegt, und wir haben sie ausführlich in dem Artikel über Scraping unter der DSGVO behandelt.

Einfach ausgedrückt, Proxys lösen das technische Zugangsproblem, geben aber keine rechtliche Grundlage. Compliance liegt darin, was und warum Sie sammeln, nicht darin, über welche IP.

Warum gewöhnliche Skripte nach fünf Minuten sterben

LinkedIn hat einen mehrschichtigen Schutz aufgebaut, und das Verständnis seiner Struktur bestimmt direkt, was Sie benötigen.

Autorisierungswand

Öffentlich, ohne Anmeldung, sind das Basisprofil, die Unternehmensübersichtsseite, Stellenangebote und die Jobsuche verfügbar. Aber nach dem Ansehen von nur 3–5 Profilen zeigt LinkedIn ein Anmeldefenster. Das ist kein Bug — das ist die erste Verteidigungslinie: Die Plattform schränkt absichtlich die anonyme Ansicht ein.

Verhaltensanalyse

Die zweite Schicht verfolgt, wie Sie sich auf der Website bewegen: Zeitabstände zwischen Anfragen (ein Mensch öffnet nicht 100 Profile pro Minute), Navigationsmuster, Mausbewegungen, den Übergangspfad (referrer). Alle Signale werden in einen „Fraud Score“ zusammengefasst und mit dem typischen Verhalten eines echten Benutzers verglichen.

Fingerprinting der Anfrage

Die dritte Schicht ist der Fingerabdruck der Verbindung. LinkedIn analysiert die Qualität der IP (residential aus dem Heimnetzwerk oder datacenter aus dem Hosting), den TLS/JA3-Fingerabdruck des Clients, Header und Cookies, Metadaten des Geräts. Wenn der TLS-Fingerabdruck python-requests anzeigt und nicht echtes Chrome, wird man sofort erkannt — selbst über einen perfekten residential Proxy.

Ein separates Marker, das Sie zuerst treffen werden, ist HTTP-Status 999. Dies ist ein nicht standardmäßiger Code, der einzigartig für LinkedIn ist: So reagiert die Plattform auf verdächtigen Traffic. Dieser wird durch nicht-browserbasierte User-Agents (curl, python-requests, wget), hohe Anfragefrequenzen von einer IP oder einem Netzwerk, datacenter und Cloud-Bereiche, die robots.txt ignorieren, provoziert. Wenn Sie 999 erhalten, beenden Sie die Anfragen von dieser IP, warten Sie 30–60 Sekunden und versuchen Sie einen anderen Proxy.

Wie man LinkedIn 2026 parst: Schritt für Schritt

  1. Bestimmen Sie den Einstiegspunkt. DOM-Scraping von HTML auf LinkedIn funktioniert 2026 praktisch nicht — das Markup ist dynamisch und verworren. Daten werden über application/ld+json-Tags auf Profil-, Unternehmens- und Stellenangebotsseiten sowie über interne XHR-Endpunkte der Paginierung (z. B. seeMoreJobPostings/search?start=25 mit einer Schrittweite von 25 Ergebnissen) bereitgestellt. Die Hauptquelle für „lebendige“ Daten ist die interne REST-Schnittstelle von LinkedIn (Voyager API), die die Website selbst speist. Wichtig: Diese API ist nicht dokumentiert, LinkedIn überwacht sie aktiv auf Missbrauch und bannt Konten, die über Voyager arbeiten, innerhalb von 3–7 Tagen. Aus diesem Grund ist es sicherer, sich auf öffentliche Seiten ohne Anmeldung zu beschränken.
  2. Fälschen Sie einen echten Browser auf TLS-Ebene. Es reicht nicht aus, einen Browser-User-Agent in den Headern zu setzen. Sie benötigen einen Client mit einem TLS- und HTTP/2-Fingerabdruck, der mit Chrome kompatibel ist: Bibliotheken wie curl_cffi (impersonate), uTLS oder ein headless-Browser (Playwright/Puppeteer mit stealth-Konfiguration). Ein residential Proxy mit dem Fingerabdruck python-requests wird trotzdem scheitern.
  3. Schließen Sie die richtigen Proxys an und rotieren Sie pro Sitzung. Rotieren Sie IP pro Sitzung, nicht für jede Anfrage, wenn Sie Cookies zwischen Seiten speichern möchten. Häufiger IP-Wechsel innerhalb einer logischen Kette sieht verdächtig aus.
  4. Halten Sie ein menschliches Tempo. Im Jahr 2026 liegt die sichere Grenze bei etwa 20–30 Anfragen an Profile von einer IP pro Stunde; darüber wird das Rate Limiting aktiviert. Setzen Sie zufällige Pausen zwischen den Anfragen (nicht feste 1,5 Sekunden für alles), randomisieren Sie die Reihenfolge und Intervalle. Der Abstand zwischen dem Ansehen von Profilen ist wichtiger als deren Gesamtzahl.
  5. Beginnen Sie mit geringem Parallelismus. Starten Sie nicht sofort 50 Threads. Beginnen Sie mit 2–3 gleichzeitigen Sitzungen und erhöhen Sie die Anzahl, während Sie den Anteil der 999-Antworten und Captchas beobachten.
  6. Behandeln Sie Sperren angemessen. Erfassen Sie 999 und Captchas als Signal und nicht als Fehler: Verringern Sie das Tempo, wechseln Sie den Proxy, machen Sie eine Pause. Protokollieren Sie die Erfolgsquote für jedes IP-Pool — daran erkennen Sie, wann der Pool „ausgebrannt“ ist.

Fallstricke

  • Die Versuchung, sich für „vollständige“ Daten anzumelden. Die Suche nach Personen, erweiterte Unternehmensdaten und Recruiter-Tools sind nur unter Anmeldung verfügbar — aber genau der Login verwandelt das Sammeln in einen Verstoß gegen die ToS und setzt Ihr Konto einem Bann innerhalb von 3–7 Tagen aus. Wiegen Sie das Risiko nüchtern ab.
  • Datacenter-Proxys. LinkedIn führt Blocklisten für ASN von Hosting-Anbietern und markiert frische datacenter IPs innerhalb von Minuten. Für LinkedIn ist das fast garantiert ein 999.
  • Gefälschte Konten. Technisch verlockend, rechtlich — ein direkter Weg zu einer Klage nach CFAA. Beide lautstarken Fälle aus den Jahren 2022 und 2025 basierten darauf.
  • Personenbezogene Daten und DSGVO. „Profil ist offen“ bedeutet nicht „Daten können verarbeitet werden“. Für ein Publikum aus der EU ist eine rechtliche Grundlage unabhängig von Proxys erforderlich.
  • Kostenlose Proxys. Öffentliche IP-Listen sind seit langem auf den schwarzen Listen von LinkedIn und oft kompromittiert — Geld und Zeit sind verschwendet.

Welche Proxys für LinkedIn benötigt werden — und warum

Der Typ des Proxys ist hier entscheidender als der Code des Scrapers selbst. Die Situation für 2026 sieht so aus:

  • Datacenter — funktionieren nicht. LinkedIn erkennt sofort Hosting-ASNs. Für diese Plattform scheidet ein Datacenter fast vollständig aus, egal wie günstig es ist.
  • Residential — das absolute Minimum. Dies sind IPs von echten Heim-Internet-Anbietern: Für das System sieht die Anfrage aus wie aus einer normalen Wohnung. Rotierende residential Proxys bieten das beste Verhältnis von „Preis pro erfolgreicher Anfrage“ und halten in branchenspezifischen Messungen 85–92% erfolgreiche Anfragen. Dies ist die Basis für das Sammeln öffentlicher Profile und Stellenangebote in großem Umfang.
  • Mobile — die höchste Klasse für LinkedIn. Mobile 4G/5G Proxys verwenden Betreiber-IP über CGNAT, die Tausende von echten Abonnenten teilen. LinkedIn kann eine solche IP nicht sperren, ohne viele legitime mobile Benutzer zu beeinträchtigen — daher sind mobile Adressen für die Plattform praktisch nicht von echtem Traffic zu unterscheiden. Sie kosten mehr pro Gigabyte, amortisieren sich jedoch in den sensibelsten Szenarien und bei hohem Tempo.

Die praktische Kombination für 2026: residential Proxys für das Hauptvolumen plus mobile für „schwere“ Abschnitte und hohen Parallelismus — und unbedingt über einem Chrome-kompatiblen TLS-Fingerabdruck. Proxys ohne korrekten Fingerabdruck helfen nicht, und ein korrekter Fingerabdruck ohne qualitativ hochwertige IP wird auf 999 stoßen.

Fazit

Das Parsen von LinkedIn im Jahr 2026 ist nicht „einfach requests setzen und loslegen“. Die Plattform hat wichtige Gerichtsverfahren gewonnen, ganze Dienste geschlossen und filtert Bots auf IP-, TLS-Fingerabdruck- und Verhaltensniveau. Eine funktionierende Strategie: nur öffentlich zugängliche Daten ohne Anmeldung sammeln, keine gefälschten Konten erzeugen, ein menschliches Tempo von 20–30 Anfragen pro IP und Stunde halten, einen echten Browser auf TLS-Ebene fälschen und auf eine qualitativ hochwertige Proxy-Infrastruktur setzen — residential IPs als Basis und mobile als Verstärkung. Der Wert hat sich von Code zu einer tragenden Schicht der Identität verschoben: Gewinnt, wer eine saubere, von einem echten Benutzer nicht zu unterscheidende IP hat. Die Auswahl von residential und mobilen Proxys für die Scraping-Aufgaben kann im ProxyCove-Katalog erfolgen — mit Geo-Targeting und Rotation für das gewünschte Tempo.