Im Mai 2026 schloss Reddit den nicht authentifizierten Zugang zu .json-Endpunkten – der Trick „füge .json zu jeder URL hinzu“, auf dem Dutzende von Skripten, Dashboards und Pet-Projekten jahrelang basierten. Überprüfung am 28. Juli 2026: Eine Anfrage an https://www.reddit.com/r/webscraping/top.json?t=week mit einem normalen Browser-User-Agent gibt 403 Forbidden zurück. Gleichzeitig enthält robots.txt von Reddit nur zwei bedeutende Zeilen: User-agent: * und Disallow: / – mit Verweis auf die Public Content Policy.
Das ändert nicht „wie man umgeht“, sondern wie man jetzt überhaupt einen Datenpipeline für Reddit aufbaut. Unten ist ein funktionierendes Schema für 2026: was tatsächlich verfügbar ist, welche Limits gelten, wo Proxys benötigt werden und wo sie nicht helfen.
Was genau kaputt gegangen ist: kurze Chronologie
- Juni 2023 – Reddit führte einen kostenpflichtigen Tarif von 0,24 $ pro 1000 API-Aufrufen für stark belastete Anwendungen ein. Folge: Schließung von Apollo (der Entwickler schätzte die Kosten für den Zugang auf etwa 20 Millionen $ pro Jahr), Abwanderung der meisten Drittanbieter-Clients und Stilllegung von Pushshift – einem öffentlichen Archiv von Posts und Kommentaren, auf dem die Hälfte der akademischen Forschung basierte.
- Mai 2026 – Abkündigung des nicht authentifizierten
.json. Werkzeuge, die „einfach die URL abfragten“, hörten auf zu funktionieren; der Verkehr ging durch den Cloudflare-Schutz mit Sitzungsüberprüfung. - Oktober 2025 – bis heute – Klage von Reddit gegen Perplexity AI, Oxylabs UAB, AWMProxy und SerpApi (Südbezirk New York, Richter Engelmaier). Reddit beschuldigt die Beklagten des industriellen Extrahierens seiner Inhalte über die Google-Ausgabe und des Weiterverkaufs von Daten unter Berufung auf die Anti-Circumvention-Bestimmungen des DMCA. Die erste geänderte Klage wurde eingereicht; Stand März 2026 befindet sich der Fall in der Phase des Antrags auf Abweisung. Die Beklagten bestreiten die Verstöße: Perplexity bezeichnet dies als Versuch, öffentliche Daten zu schließen, SerpApi und Oxylabs behaupten, Zugang zum öffentlichen Web im Rahmen des Gesetzes zu haben.
Praktische Schlussfolgerung aus dem dritten Punkt: Das Sammeln von Daten von Reddit außerhalb der offiziellen API ist kein technisches, sondern ein rechtliches Risiko, und der Preis eines Fehlers für ein kommerzielles Projekt wird nicht in Sperren, sondern in Klagen gemessen. Mehr dazu, wie die Gerichte 2026 das Extrahieren von Daten aus den Ergebnissen interpretieren, haben wir in dem Artikel über die Entscheidung im Fall Google und SerpApi behandelt.
Offizielle Data API: reale Limits 2026
Dies ist der einzige Weg, der keine rechtlichen Ansprüche aufwirft. Zahlen, die man vor der Planung wissen sollte:
- 100 Anfragen pro Minute für OAuth-Clients. Das Fenster wird über etwa 10 Minuten gemittelt, das heißt, kurze Spitzen sind zulässig.
- 10 Anfragen pro Minute ohne OAuth – das reicht für nichts außer Debugging.
- Das Limit wird pro Anwendungsschlüssel und nicht pro Endbenutzer betrachtet. Fünf Streams auf einem Token bieten nicht fünfmal die Kapazität – sie verbrauchen einfach ein Budget fünfmal schneller.
- Der kostenlose Tarif deckt persönliche Projekte, Bots, Moderationstools und akademische Forschung ab. Es gibt keinen Geldzähler, nur eine Obergrenze für die Frequenz.
- Kommerzielle Nutzung erfordert einen Vertrag und manuelle Genehmigung; Tarif – 0,24 $ pro 1000 Aufrufen. Schätzungen von Branchenplattformen zufolge beginnt die Eintrittsbarriere für einen kommerziellen Vertrag bei etwa 12.000 $ pro Jahr.
- Das Trainieren von ML-Modellen mit API-Daten ist ausdrücklich verboten durch die Bedingungen der Data API. Lizenzen für das Training sind separate private Verträge (die Vereinbarung von Reddit mit Google wurde in der Presse auf etwa 60 Millionen $ pro Jahr geschätzt).
Überschriften, die immer geparst werden müssen
Reddit gibt für jede Antwort drei Überschriften zurück: X-Ratelimit-Used, X-Ratelimit-Remaining und X-Ratelimit-Reset. Dies ist die einzige verlässliche Quelle für die Wahrheit über Ihr Budget – keine Konstante im Code und kein altes Wiki mit der Zahl „60 Anfragen pro Minute“ (die ist seit 2023 veraltet).
Anforderungen an den User-Agent
Reddit erwartet eine einzigartige beschreibende Zeichenfolge im Format platform:app_id:version (by /u/username). Universelle und leere User-Agents werden stark in der Frequenz beschnitten – das ist das erste, was man überprüfen sollte, wenn die Limits früher enden als erwartet.
Schritt für Schritt: Wie man eine Pipeline aufbaut, die nicht abstürzt
- Registrieren Sie eine Script-App in den Einstellungen von Reddit und erhalten Sie client_id/client_secret. Für eine read-only Last ist dies der einfachste Anwendungs-Typ.
- Setzen Sie einen korrekten User-Agent gemäß dem obigen Format. Kopieren Sie nicht die Zeichenfolge aus einem fremden Tutorial –
app_idund Nickname sollten Ihre eigenen sein. - Lesen Sie
X-Ratelimit-Remainingbei jeder Antwort, nicht nur bei einem Fehler. Wenn der Rest auf etwa 20 Anfragen fällt, wechseln Sie zu einem gleichmäßigen Tempo: Verzögerung pro Aufruf = Sekunden bis zum Zurücksetzen des Fensters ÷ verbleibende Anfragen. So verteilen Sie das Kontingent über das Fenster, anstatt gegen eine Wand zu stoßen. - Behandeln Sie 429 richtig. Die erste Pause nehmen Sie aus dem Header
Retry-After. Danach – exponentieller Backoff mit Jitter:wait = 2^attempt + random(). Jitter ist zwingend erforderlich: Ohne ihn wiederholen parallele Clients die Anfrage synchron und verursachen einen zweiten Kaskadenfehler. - Cache-Lesungen mit TTL. Eine wiederholte Anfrage desselben Listings ist der häufigste Grund für das Ausschöpfen des Kontingents in Monitoring-Projekten.
- Skalieren Sie durch Token-Rotation, nicht durch Streams. Jeder OAuth-Token trägt einen unabhängigen Zähler; mehrere Anwendungen auf verschiedenen Konten mit Round-Robin-Verteilung (in Python –
itertools.cycle) erhöhen die Durchsatzrate linear. Wichtig: Für kommerzielle Lasten ersetzt dies nicht den Vertrag mit Reddit – es ist ein Weg, sich an die fairen Limits zu halten, nicht sie zu umgehen. - Planen Sie einen Umgehungsmechanismus für das Listing-Cap ein. Reddit gibt maximal etwa 1000 Elemente pro Listing zurück (100 pro Seite, Cursor
after). Ältere Inhalte sind über die Standard-Endpunkte nicht verfügbar. Die Standardlösung besteht darin, nicht das Cap zu „durchbrechen“, sondern die Auswahl nach Zeit zu schneiden und mehrere enge Anfragen anstelle einer breiten zu stellen. - Für historische Daten suchen Sie nach einem Index, nicht nach einer API. Nach der Schließung von Pushshift übernehmen externe Indizes wie PullPush (kostenlos, aber ohne SLA) und kommerzielle Such-APIs mit ihrem eigenen Index und anderen Obergrenzen dessen Nische. Für akademische Arbeiten hat Reddit ein separates Programm Reddit for Researchers.
Fallstricke, von denen man spät erfährt
PRAW dämpft den Fluss, schützt aber nicht vor allem. Der eingebaute Limiter von PRAW liest die Header und setzt selbst Pausen – das funktioniert hervorragend für ein einzelnes Skript. Der aktuelle Zustand ist über reddit.auth.limits sichtbar. Dies bricht in zwei Fällen: bei Multithreading mit gemeinsamen Anmeldeinformationen (Instanzen sehen den Verbrauch des anderen nicht) und im Async-Code, wo der blockierende time.sleep die Event-Schleife aufhängt.
AI-Agenten verbrauchen das Kontingent unbemerkt. Ein Schritt der Argumentation eines Agenten kann leicht in 10–15 Aufrufe von Werkzeugen umgewandelt werden. Zehn parallele Sitzungen sind 100–150 gleichzeitige Anfragen, das heißt, das gesamte Minutenbudget ist in Sekunden aufgebraucht. Wenn Sie einen Agenten über Reddit aufbauen, ist ein Limiter auf Pool-Ebene erforderlich, nicht auf der Ebene eines einzelnen Aufrufs.
Abfragen ohne Backoff. Die Überprüfung von Updates „alle N Sekunden“ ohne exponentielle Pause ist die zweithäufigste Ursache für 429 nach einem gemeinsamen Token.
Wo Proxys wirklich benötigt werden und wo nicht
Seien wir ehrlich: Proxys erhöhen nicht Ihr Limit der offiziellen API. Das Kontingent ist an den Anwendungsschlüssel und nicht an die ausgehende IP gebunden, und der Versuch, es durch Adresswechsel zu „vervielfältigen“, funktioniert nicht und verstößt gegen die Bedingungen. Aufgaben, die Proxys im Reddit-Pipeline tatsächlich lösen, sind andere:
- Geo-Zugang und Konnektivität. Reddit ist in mehreren Ländern nicht verfügbar oder teilweise eingeschränkt, und Unternehmensnetzwerke blockieren es als soziale Netzwerke. Ein stabiler Ausgangsknoten in der benötigten Region ist eine Frage der Verfügbarkeit der Infrastruktur, nicht der Umgehung von Limits. Für serverseitige Aufgaben mit einer festen IP sind normalerweise Rechenzentrums-Proxys ausreichend.
- Regionale Ausgabe. Ein Teil des Inhalts und der Empfehlungen von Reddit wird unter Berücksichtigung der Geografie der Anfrage ausgegeben; wenn Sie analysieren, was das Publikum eines bestimmten Landes sieht, benötigen Sie einen Zugang genau aus diesem Land.
- Verteilung der Infrastruktur. Wenn mehrere unabhängige Dienste (Sammlung, Überwachung von Erwähnungen, Analytik) auf demselben Server leben, wird eine einzige IP zu einem gemeinsamen Ausfallpunkt für alle Integrationen.
- Arbeiten mit eigenen Konten. Für Moderation, Community-Management und legale SMM-Aktivitäten von mehreren Profilen ist die Verbindung „Konto ↔ feste IP“ grundlegende Hygiene. Hier sind residential Proxys mit Sticky-Sitzungen angebracht.
Was Proxys jedoch nicht tun werden: Sie legalisieren keine kommerzielle Datensammlung außerhalb des Vertrags, heben das Listing-Cap von 1000 Elementen nicht auf und annullieren nicht Disallow: / in robots.txt. Der allgemeine Ansatz zur Arbeit mit den Limits der Plattformen ist in der Analyse über Rate Limiting in APIs und die Rolle von Proxys zu finden.
Fazit
Reddit hat 2026 endgültig aufgehört, ein „offenes Dataset zu sein, das man mit .json abgreifen kann“. Das funktionierende Schema sieht so aus: offizieller OAuth-Zugang + fairer Limiter in den Headern + Token-Rotation im Rahmen der Regeln + externer Index für die Historie. Proxys in diesem Schema sind für Verfügbarkeit und Geografie verantwortlich, nicht für die Umgehung von Quoten – und das ist die einzige Rolle, in der sie vorhersehbare Ergebnisse liefern.
Wenn Ihr Projekt kommerziell ist, planen Sie das Budget für einen Vertrag mit Reddit im Voraus: Die Rechtshistorie mit Perplexity, Oxylabs und SerpApi zeigt, dass die Plattform bereit ist, erheblich mehr für den Schutz ihrer Daten auszugeben, als der legale Zugang kostet.
```