LinkedIn ist die am stĂ€rksten geschĂŒtzte der groĂen Plattformen und gleichzeitig die verlockendste Quelle fĂŒr B2B-Daten: Profile von Fachleuten, Unternehmen, Stellenangebote, Einblicke fĂŒr die Lead-Generierung und Rekrutierung. Im Jahr 2026 wurde das Sammeln dieser Daten deutlich schwieriger und riskanter. LinkedIn gewann einen Rechtsstreit gegen hiQ Labs, verklagte und schloss den gröĂten Scraping-Dienst Proxycurl, und auf technischer Ebene lernte es, Bots bereits zu filtern, bevor Sie die erste Zeile HTML erhalten. Lassen Sie uns Schritt fĂŒr Schritt durchgehen, wie man öffentliche Daten von LinkedIn im Jahr 2026 parst, wo die rechtliche und technische Grenze verlĂ€uft und welche Proxys tatsĂ€chlich die Last tragen.
FĂŒr wen und warum das notwendig ist
Scraping von LinkedIn ist kein âgrauer Hackâ, sondern ein funktionales Werkzeug fĂŒr durchaus legale Aufgaben: Lead-Generierung fĂŒr B2B-VerkĂ€ufe, Analyse des Arbeitsmarktes und der GehĂ€lter, Ăberwachung von Wettbewerbern und deren Einstellungen, Anreicherung von CRM, Branchenforschung. Das Problem ist, dass LinkedIn seine Daten als Vermögenswert betrachtet und sie aggressiver schĂŒtzt als jede andere Social Media Plattform. Daher ist es wichtig, vor dem ersten Anfrage zu verstehen, zwei Dinge: was man gesetzlich sammeln darf und warum gewöhnlicher Code nach fĂŒnf Minuten an die Wand stöĂt.
Rechtliche Grenze: Was das Jahr 2026 gezeigt hat
Die gröĂte Fehlannahme ist: âDie Daten sind öffentlich, also kann man sie frei abholenâ. Die Rechtsprechung der letzten Jahre sagt genau das Gegenteil.
Der Fall hiQ Labs gegen LinkedIn wurde lange als Sieg fĂŒr Scraper angesehen: Das Berufungsgericht des neunten Bezirks stellte 2019 und 2022 fest, dass der Zugang zu öffentlich zugĂ€nglichen Profilen das Anti-Hacking-Gesetz CFAA nicht verletzt. Aber im November 2022 stellte dasselbe Gericht im Wesentlichen auf die Seite von LinkedIn: Das Verbot des Scraping in den Nutzungsbedingungen wurde als rechtlich durchsetzbar anerkannt. Am 7. Dezember 2022 einigten sich die Parteien auf einen Vergleich â hiQ musste 500.000 Dollar zahlen (Vertragsverletzung plus CFAA wegen gefĂ€lschter Konten) und erhielt ein dauerhaftes Verbot mit der Verpflichtung, gesamten Code und gesammelte Daten zu vernichten. Die Firma hiQ stellte ihre Existenz ein.
Ein weiterer aufschlussreicher Fall ist Proxycurl (Firma Nubela), die gröĂte API fĂŒr LinkedIn-Daten. Am 24. Januar 2025 reichte LinkedIn gegen sie eine Bundesklage im nördlichen Bezirk Kalifornien aus sechs GrĂŒnden ein: Vertragsverletzung, Betrug, CFAA, kalifornisches Gesetz ĂŒber unlauteren Wettbewerb und andere. Proxycurl wurde beschuldigt, Hunderttausende gefĂ€lschter Konten erstellt zu haben, um Millionen von Profilen zu sammeln, einschlieĂlich nicht öffentlicher Daten. Der Fall wurde Mitte 2025 beigelegt: Im Juli verabschiedete sich der Dienst von seinen Kunden und stellte den Betrieb ein. Der GrĂŒnder schrieb direkt, dass das GeschĂ€ft etwa 10 Millionen Dollar Umsatz brachte, etwa die HĂ€lfte davon stammte aus dem Scraping von LinkedIn, und âin diesem Kampf kann man nicht gewinnenâ gegen ein Unternehmen mit praktisch unbegrenztem rechtlichen Budget. Die Bedingungen des Verbots galten auch fĂŒr die Kunden von Proxycurl.
Die Schlussfolgerung fĂŒr die Praxis ist Ă€uĂerst konkret:
- Loggen Sie sich nicht ein. Sobald Sie sich anmelden, akzeptieren Sie die Nutzungsbedingungen, die jegliches automatisierte Sammeln verbieten. Scraping von einem Konto ist ein direkter Vertragsbruch, auf dem LinkedIn die Gerichtsverfahren gewinnt.
- Keine gefĂ€lschten Konten. Sowohl hiQ als auch Proxycurl wurden genau durch die Masse gefĂ€lschter Profile âuntergegangenâ â das ist ein separates Vergehen gegen CFAA.
- Sammlung nur von öffentlich zugĂ€nglichen und nicht personenbezogenen Daten, wo es möglich ist. Hier kommt die DSGVO ins Spiel: Das Sammeln personenbezogener Daten sogar aus offenen Profilen ohne rechtliche Grundlage in der EU wird als VerstoĂ angesehen â diese Logik hat der europĂ€ische Regulierer separat festgelegt, und wir haben sie ausfĂŒhrlich in dem Artikel ĂŒber Scraping unter der DSGVO behandelt.
Einfach ausgedrĂŒckt, Proxys lösen das technische Zugangsproblem, geben aber keine rechtliche Grundlage. Compliance liegt darin, was und warum Sie sammeln, nicht darin, ĂŒber welche IP.
Warum gewöhnliche Skripte nach fĂŒnf Minuten sterben
LinkedIn hat einen mehrschichtigen Schutz aufgebaut, und das VerstÀndnis seiner Struktur bestimmt direkt, was Sie benötigen.
Autorisierungswand
Ăffentlich, ohne Anmeldung, sind das Basisprofil, die UnternehmensĂŒbersichtsseite, Stellenangebote und die Jobsuche verfĂŒgbar. Aber nach dem Ansehen von nur 3â5 Profilen zeigt LinkedIn ein Anmeldefenster. Das ist kein Bug â das ist die erste Verteidigungslinie: Die Plattform schrĂ€nkt absichtlich die anonyme Ansicht ein.
Verhaltensanalyse
Die zweite Schicht verfolgt, wie Sie sich auf der Website bewegen: ZeitabstĂ€nde zwischen Anfragen (ein Mensch öffnet nicht 100 Profile pro Minute), Navigationsmuster, Mausbewegungen, den Ăbergangspfad (referrer). Alle Signale werden in einen âFraud Scoreâ zusammengefasst und mit dem typischen Verhalten eines echten Benutzers verglichen.
Fingerprinting der Anfrage
Die dritte Schicht ist der Fingerabdruck der Verbindung. LinkedIn analysiert die QualitĂ€t der IP (residential aus dem Heimnetzwerk oder datacenter aus dem Hosting), den TLS/JA3-Fingerabdruck des Clients, Header und Cookies, Metadaten des GerĂ€ts. Wenn der TLS-Fingerabdruck python-requests anzeigt und nicht echtes Chrome, wird man sofort erkannt â selbst ĂŒber einen perfekten residential Proxy.
Ein separates Marker, das Sie zuerst treffen werden, ist HTTP-Status 999. Dies ist ein nicht standardmĂ€Ăiger Code, der einzigartig fĂŒr LinkedIn ist: So reagiert die Plattform auf verdĂ€chtigen Traffic. Dieser wird durch nicht-browserbasierte User-Agents (curl, python-requests, wget), hohe Anfragefrequenzen von einer IP oder einem Netzwerk, datacenter und Cloud-Bereiche, die robots.txt ignorieren, provoziert. Wenn Sie 999 erhalten, beenden Sie die Anfragen von dieser IP, warten Sie 30â60 Sekunden und versuchen Sie einen anderen Proxy.
Wie man LinkedIn 2026 parst: Schritt fĂŒr Schritt
- Bestimmen Sie den Einstiegspunkt. DOM-Scraping von HTML auf LinkedIn funktioniert 2026 praktisch nicht â das Markup ist dynamisch und verworren. Daten werden ĂŒber
application/ld+json-Tags auf Profil-, Unternehmens- und Stellenangebotsseiten sowie ĂŒber interne XHR-Endpunkte der Paginierung (z. B.seeMoreJobPostings/search?start=25mit einer Schrittweite von 25 Ergebnissen) bereitgestellt. Die Hauptquelle fĂŒr âlebendigeâ Daten ist die interne REST-Schnittstelle von LinkedIn (Voyager API), die die Website selbst speist. Wichtig: Diese API ist nicht dokumentiert, LinkedIn ĂŒberwacht sie aktiv auf Missbrauch und bannt Konten, die ĂŒber Voyager arbeiten, innerhalb von 3â7 Tagen. Aus diesem Grund ist es sicherer, sich auf öffentliche Seiten ohne Anmeldung zu beschrĂ€nken. - FĂ€lschen Sie einen echten Browser auf TLS-Ebene. Es reicht nicht aus, einen Browser-User-Agent in den Headern zu setzen. Sie benötigen einen Client mit einem TLS- und HTTP/2-Fingerabdruck, der mit Chrome kompatibel ist: Bibliotheken wie
curl_cffi(impersonate),uTLSoder ein headless-Browser (Playwright/Puppeteer mit stealth-Konfiguration). Ein residential Proxy mit dem Fingerabdruckpython-requestswird trotzdem scheitern. - SchlieĂen Sie die richtigen Proxys an und rotieren Sie pro Sitzung. Rotieren Sie IP pro Sitzung, nicht fĂŒr jede Anfrage, wenn Sie Cookies zwischen Seiten speichern möchten. HĂ€ufiger IP-Wechsel innerhalb einer logischen Kette sieht verdĂ€chtig aus.
- Halten Sie ein menschliches Tempo. Im Jahr 2026 liegt die sichere Grenze bei etwa 20â30 Anfragen an Profile von einer IP pro Stunde; darĂŒber wird das Rate Limiting aktiviert. Setzen Sie zufĂ€llige Pausen zwischen den Anfragen (nicht feste 1,5 Sekunden fĂŒr alles), randomisieren Sie die Reihenfolge und Intervalle. Der Abstand zwischen dem Ansehen von Profilen ist wichtiger als deren Gesamtzahl.
- Beginnen Sie mit geringem Parallelismus. Starten Sie nicht sofort 50 Threads. Beginnen Sie mit 2â3 gleichzeitigen Sitzungen und erhöhen Sie die Anzahl, wĂ€hrend Sie den Anteil der 999-Antworten und Captchas beobachten.
- Behandeln Sie Sperren angemessen. Erfassen Sie 999 und Captchas als Signal und nicht als Fehler: Verringern Sie das Tempo, wechseln Sie den Proxy, machen Sie eine Pause. Protokollieren Sie die Erfolgsquote fĂŒr jedes IP-Pool â daran erkennen Sie, wann der Pool âausgebranntâ ist.
Fallstricke
- Die Versuchung, sich fĂŒr âvollstĂ€ndigeâ Daten anzumelden. Die Suche nach Personen, erweiterte Unternehmensdaten und Recruiter-Tools sind nur unter Anmeldung verfĂŒgbar â aber genau der Login verwandelt das Sammeln in einen VerstoĂ gegen die ToS und setzt Ihr Konto einem Bann innerhalb von 3â7 Tagen aus. Wiegen Sie das Risiko nĂŒchtern ab.
- Datacenter-Proxys. LinkedIn fĂŒhrt Blocklisten fĂŒr ASN von Hosting-Anbietern und markiert frische datacenter IPs innerhalb von Minuten. FĂŒr LinkedIn ist das fast garantiert ein 999.
- GefĂ€lschte Konten. Technisch verlockend, rechtlich â ein direkter Weg zu einer Klage nach CFAA. Beide lautstarken FĂ€lle aus den Jahren 2022 und 2025 basierten darauf.
- Personenbezogene Daten und DSGVO. âProfil ist offenâ bedeutet nicht âDaten können verarbeitet werdenâ. FĂŒr ein Publikum aus der EU ist eine rechtliche Grundlage unabhĂ€ngig von Proxys erforderlich.
- Kostenlose Proxys. Ăffentliche IP-Listen sind seit langem auf den schwarzen Listen von LinkedIn und oft kompromittiert â Geld und Zeit sind verschwendet.
Welche Proxys fĂŒr LinkedIn benötigt werden â und warum
Der Typ des Proxys ist hier entscheidender als der Code des Scrapers selbst. Die Situation fĂŒr 2026 sieht so aus:
- Datacenter â funktionieren nicht. LinkedIn erkennt sofort Hosting-ASNs. FĂŒr diese Plattform scheidet ein Datacenter fast vollstĂ€ndig aus, egal wie gĂŒnstig es ist.
- Residential â das absolute Minimum. Dies sind IPs von echten Heim-Internet-Anbietern: FĂŒr das System sieht die Anfrage aus wie aus einer normalen Wohnung. Rotierende residential Proxys bieten das beste VerhĂ€ltnis von âPreis pro erfolgreicher Anfrageâ und halten in branchenspezifischen Messungen 85â92% erfolgreiche Anfragen. Dies ist die Basis fĂŒr das Sammeln öffentlicher Profile und Stellenangebote in groĂem Umfang.
- Mobile â die höchste Klasse fĂŒr LinkedIn. Mobile 4G/5G Proxys verwenden Betreiber-IP ĂŒber CGNAT, die Tausende von echten Abonnenten teilen. LinkedIn kann eine solche IP nicht sperren, ohne viele legitime mobile Benutzer zu beeintrĂ€chtigen â daher sind mobile Adressen fĂŒr die Plattform praktisch nicht von echtem Traffic zu unterscheiden. Sie kosten mehr pro Gigabyte, amortisieren sich jedoch in den sensibelsten Szenarien und bei hohem Tempo.
Die praktische Kombination fĂŒr 2026: residential Proxys fĂŒr das Hauptvolumen plus mobile fĂŒr âschwereâ Abschnitte und hohen Parallelismus â und unbedingt ĂŒber einem Chrome-kompatiblen TLS-Fingerabdruck. Proxys ohne korrekten Fingerabdruck helfen nicht, und ein korrekter Fingerabdruck ohne qualitativ hochwertige IP wird auf 999 stoĂen.
Fazit
Das Parsen von LinkedIn im Jahr 2026 ist nicht âeinfach requests setzen und loslegenâ. Die Plattform hat wichtige Gerichtsverfahren gewonnen, ganze Dienste geschlossen und filtert Bots auf IP-, TLS-Fingerabdruck- und Verhaltensniveau. Eine funktionierende Strategie: nur öffentlich zugĂ€ngliche Daten ohne Anmeldung sammeln, keine gefĂ€lschten Konten erzeugen, ein menschliches Tempo von 20â30 Anfragen pro IP und Stunde halten, einen echten Browser auf TLS-Ebene fĂ€lschen und auf eine qualitativ hochwertige Proxy-Infrastruktur setzen â residential IPs als Basis und mobile als VerstĂ€rkung. Der Wert hat sich von Code zu einer tragenden Schicht der IdentitĂ€t verschoben: Gewinnt, wer eine saubere, von einem echten Benutzer nicht zu unterscheidende IP hat. Die Auswahl von residential und mobilen Proxys fĂŒr die Scraping-Aufgaben kann im ProxyCove-Katalog erfolgen â mit Geo-Targeting und Rotation fĂŒr das gewĂŒnschte Tempo.
