Back to Blog

2026 में Reddit डेटा कैसे इकट्ठा करें: API सीमाएँ, बंद .json और प्रॉक्सी की भूमिका

मई 2026 में Reddit ने गैर-प्रमाणित .json को बंद कर दिया, और robots.txt सभी के लिए Disallow: / देता है। हम आधिकारिक Data API (100 QPM, $0.24 प्रति 1000 कॉल) के वास्तविक सीमाओं, स्थायी पाइपलाइन की चरण-दर-चरण योजना, 1000 तत्वों में लिस्टिंग-कैप और यह देखते हैं कि इस योजना में प्रॉक्सी के कौन से कार्य वास्तव में हल करते हैं, और कौन से नहीं।

📅July 28, 2026
2026 में Reddit डेटा कैसे इकट्ठा करें: API सीमाएँ, बंद .json और प्रॉक्सी की भूमिका
```html

मई 2026 में Reddit ने .json एंडपॉइंट्स के लिए बिना प्रमाणीकरण के पहुंच बंद कर दी — वही ट्रिक "किसी भी URL के अंत में .json जोड़ें", जिस पर वर्षों से दर्जनों स्क्रिप्ट, डैशबोर्ड और पिट प्रोजेक्ट्स निर्भर थे। 28 जुलाई 2026 की जांच: सामान्य ब्राउज़र यूजर-एजेंट के साथ https://www.reddit.com/r/webscraping/top.json?t=week पर अनुरोध 403 Forbidden लौटाता है। साथ ही, Reddit का robots.txt केवल दो महत्वपूर्ण पंक्तियाँ रखता है: User-agent: * और Disallow: / — सार्वजनिक सामग्री नीति का संदर्भ देते हुए।

यह "कैसे обход करें" को नहीं बदलता, बल्कि अब Reddit डेटा संग्रह पाइपलाइन कैसे बनानी है को बदलता है। नीचे 2026 के लिए एक कार्यशील योजना है: क्या वास्तव में उपलब्ध है, कौन से सीमाएँ हैं, कहाँ प्रॉक्सी की आवश्यकता है, और कहाँ वे मदद नहीं करेंगी।

क्या वास्तव में टूटा: संक्षिप्त कालक्रम

  • जून 2023 — Reddit ने उच्च-लोड वाले अनुप्रयोगों के लिए $0.24 प्रति 1000 API कॉल का भुगतान करने वाला टैरिफ पेश किया। परिणाम: अपोलो का बंद होना (डेवलपर ने पहुंच की लागत लगभग $20 मिलियन प्रति वर्ष आंकी), अधिकांश तृतीय-पक्ष क्लाइंट का जाना और पुशशिफ्ट का ठहराव — पोस्ट और टिप्पणियों का सार्वजनिक संग्रह, जिस पर आधे अकादमिक शोध निर्भर थे।
  • मई 2026 — बिना प्रमाणीकरण वाले .json का डिप्रिकेशन। उपकरण जो "बस URL को खींचते थे", अब काम नहीं करते; ट्रैफिक क्लाउडफ्लेयर सुरक्षा के माध्यम से सत्र की जांच के साथ जा रहा है।
  • अक्टूबर 2025 — वर्तमान — Reddit का Perplexity AI, Oxylabs UAB, AWMProxy और SerpApi के खिलाफ मुकदमा (दक्षिणी न्यूयॉर्क जिला, न्यायाधीश एंगेलमायर)। Reddit ने प्रतिवादियों पर अपने सामग्री का औद्योगिक निष्कर्षण करने और डेटा को पुनर्विक्रय करने का आरोप लगाया, Google के परिणामों के माध्यम से, DMCA के एंटी-ऑब्सट्रक्शन प्रावधानों का हवाला देते हुए। पहला संशोधित मुकदमा दायर किया गया; मार्च 2026 तक मामला मोशन टू डिस्मिस के चरण में है। प्रतिवादी उल्लंघनों से इनकार करते हैं: Perplexity इसे सार्वजनिक डेटा को बंद करने का प्रयास बताता है, SerpApi और Oxylabs कानून के तहत सार्वजनिक वेब तक पहुंच का दावा करते हैं।

तीसरे बिंदु से व्यावहारिक निष्कर्ष: Reddit से डेटा संग्रह आधिकारिक API को दरकिनार करते हुए — यह तकनीकी नहीं, बल्कि कानूनी जोखिम क्षेत्र है, और व्यावसायिक परियोजना के लिए गलती की कीमत बैन नहीं, बल्कि मुकदमे से मापी जाती है। 2026 में डेटा निष्कर्षण के लिए अदालतों की व्याख्या के बारे में अधिक जानकारी के लिए, हमने Google और SerpApi मामले के निर्णय पर सामग्री में चर्चा की।

आधिकारिक डेटा API: 2026 के वास्तविक सीमाएँ

यह एकमात्र तरीका है जो कानूनी दावों का निर्माण नहीं करता है। डिज़ाइन करने से पहले जानने के लिए आंकड़े:

  • OAuth क्लाइंट के लिए 100 अनुरोध प्रति मिनट। विंडो लगभग 10 मिनट में औसत होती है, यानी छोटे स्पाइक स्वीकार्य हैं।
  • बिना OAuth के 10 अनुरोध प्रति मिनट — यह डिबगिंग के अलावा किसी और चीज के लिए पर्याप्त नहीं है।
  • सीमा ऐप की कुंजी पर है, न कि अंतिम उपयोगकर्ता पर। एक टोकन पर पांच धारा पांच गुना क्षमता नहीं देती — वे बस एक बजट को पांच गुना तेजी से जलाते हैं।
  • फ्री टैरिफ व्यक्तिगत परियोजनाओं, बॉट्स, मॉडरेटर उपकरणों और अकादमिक अनुसंधान को कवर करता है। कोई मौद्रिक काउंटर नहीं है, केवल आवृत्ति की छत है।
  • व्यावसायिक उपयोग अनुबंध और मैनुअल अनुमोदन की आवश्यकता होती है; टैरिफ — $0.24 प्रति 1000 कॉल। उद्योग के प्लेटफार्मों के अनुसार, व्यावसायिक अनुबंध में प्रवेश का थRESHOLD लगभग $12,000 प्रति वर्ष से शुरू होता है।
  • API डेटा पर ML मॉडल का प्रशिक्षण सीधे Data API की शर्तों द्वारा निषिद्ध है. प्रशिक्षण के लिए लाइसेंस अलग निजी अनुबंध हैं (प्रेस में Reddit और Google के बीच सौदे का मूल्य लगभग $60 मिलियन प्रति वर्ष आंका गया)।

हमें हमेशा पार्स करने वाले शीर्षक

Reddit प्रत्येक उत्तर पर तीन शीर्षक देता है: X-Ratelimit-Used, X-Ratelimit-Remaining और X-Ratelimit-Reset. यह आपके बजट के बारे में सच्चाई का एकमात्र विश्वसनीय स्रोत है — कोड में कोई स्थिरता नहीं और "60 अनुरोध प्रति मिनट" के साथ पुरानी विकी नहीं (यह 2023 में ही पुरानी हो गई थी)।

User-Agent की आवश्यकताएँ

Reddit एक अद्वितीय वर्णनात्मक स्ट्रिंग की अपेक्षा करता है platform:app_id:version (by /u/username) प्रारूप में। सामान्य और खाली User-Agent को आवृत्ति के अनुसार सख्ती से काटा जाता है — यह पहली चीज है जिसे आपको जांचना चाहिए यदि सीमाएँ निर्धारित समय से पहले समाप्त हो जाती हैं।

चरण-दर-चरण: एक पाइपलाइन कैसे बनाएं, जो गिरती नहीं है

  1. Reddit की सेटिंग्स में script-app पंजीकृत करें और client_id/client_secret प्राप्त करें। पढ़ने के लिए केवल लोड के लिए, यह अनुप्रयोग का सबसे सरल प्रकार है।
  2. ऊपर दिए गए प्रारूप के अनुसार सही User-Agent सेट करें. किसी अन्य ट्यूटोरियल से स्ट्रिंग की नकल न करें — app_id और उपनाम आपके होने चाहिए।
  3. प्रत्येक उत्तर पर X-Ratelimit-Remaining पढ़ें, न कि केवल त्रुटि पर। जब शेष लगभग 20 अनुरोधों तक गिरता है, तो समान गति पर जाएं: कॉल के लिए देरी = शेष अनुरोध ÷ विंडो के रीसेट होने तक के सेकंड। इस तरह आप विंडो के अनुसार कोटा को फैलाते हैं, बजाय इसके कि आप दीवार में टकरा जाएं।
  4. 429 को सही तरीके से संभालें। पहली विराम Retry-After शीर्षक से लें। इसके बाद — एक्सपोनेंशियल बैकऑफ के साथ जिटर: wait = 2^attempt + random(). जिटर अनिवार्य है: इसके बिना, समानांतर क्लाइंट समकालिक रूप से अनुरोध दोहराते हैं और दूसरे विफलता के cascades का कारण बनते हैं।
  5. TTL के साथ रीडिंग कैश करें। एक ही लिस्टिंग के लिए पुनः अनुरोध करना — निगरानी परियोजनाओं में कोटा का लीक होने का सबसे सामान्य कारण है।
  6. धाराओं के बजाय टोकनों के रोटेशन के साथ स्केल करें। प्रत्येक OAuth टोकन एक स्वतंत्र काउंटर ले जाता है; विभिन्न खातों पर कई अनुप्रयोगों के साथ राउंड-रोबिन वितरण (Python में — itertools.cycle) रैखिक रूप से बैंडविड्थ बढ़ाता है। महत्वपूर्ण: व्यावसायिक लोड के लिए, यह Reddit के साथ अनुबंध को प्रतिस्थापित नहीं करता है — यह ईमानदार सीमाओं में समायोजित होने का एक तरीका है, न कि उन्हें दरकिनार करने का।
  7. लिस्टिंग-कैप को दरकिनार करने की योजना बनाएं। Reddit लिस्टिंग पर लगभग 1000 आइटम (प्रति पृष्ठ 100, कर्सर after) लौटाता है। अधिक पुराना सामग्री मानक एंडपॉइंट्स के माध्यम से उपलब्ध नहीं है। मानक समाधान — "कैप" को "पार" करने के बजाय, समय के अनुसार चयन को काटना और एक व्यापक अनुरोध के बजाय कई संकीर्ण अनुरोध करना।
  8. ऐतिहासिक डेटा के लिए, API के बजाय इंडेक्स खोजें। पुशशिफ्ट के बंद होने के बाद, इसकी जगह बाहरी इंडेक्स जैसे पुलपुश (फ्री, लेकिन SLA के बिना) और व्यावसायिक खोज API अपने इंडेक्स और अन्य सीमाओं के साथ ले रहे हैं। अकादमिक कार्य के लिए Reddit के पास शोधकर्ताओं के लिए Reddit के लिए एक अलग कार्यक्रम है।

विपत्तियाँ, जिनके बारे में बाद में पता चलता है

PRAW धारा को सुस्त करता है, लेकिन सब कुछ से नहीं बचाता। अंतर्निहित लिमिटर PRAW शीर्षकों को पढ़ता है और स्वयं विराम लगाता है — यह एकल धारा स्क्रिप्ट के लिए उत्कृष्ट काम करता है। वर्तमान स्थिति reddit.auth.limits के माध्यम से देखी जा सकती है। यह दो मामलों में टूटता है: साझा क्रेडेंशियल्स के साथ मल्टीथ्रेडिंग में (उदाहरण एक-दूसरे की खपत नहीं देख पाते) और असिंक्रोनस कोड में, जहाँ अवरोधक time.sleep इवेंट लूप को लटका देता है।

AI-एजेंट बिना देखे कोटा जलाते हैं। एजेंट की एक सोच का कदम आसानी से 10-15 उपकरणों के कॉल में बदल जाता है। दस समानांतर सत्र — 100-150 समवर्ती अनुरोध, यानी पूरे मिनट का बजट सेकंडों में। यदि आप Reddit के ऊपर एजेंट बना रहे हैं, तो लिमिटर पूल के स्तर पर आवश्यक है, न कि एकल कॉल के स्तर पर।

बैकऑफ के बिना सर्वेक्षण। "हर N सेकंड में अपडेट की जांच" बिना एक्सपोनेंशियल विराम के — सामान्य टोकन के बाद 429 का दूसरा सबसे सामान्य कारण।

यहाँ प्रॉक्सी की वास्तव में आवश्यकता है, और कहाँ नहीं

सच कहें: प्रॉक्सी आपके आधिकारिक API की सीमा को नहीं बढ़ाते हैं. कोटा एप्लिकेशन की कुंजी से बंधा होता है, न कि आउटगोइंग IP से, और पता बदलने के माध्यम से इसे "प्रजनन" करने का प्रयास काम नहीं करता और शर्तों का उल्लंघन करता है। प्रॉक्सी वास्तव में Reddit पाइपलाइन में जो समस्याएँ हल करती हैं, वे अन्य हैं:

  • भौगोलिक पहुंच और कनेक्टिविटी। Reddit कई देशों में अनुपलब्ध या आंशिक रूप से प्रतिबंधित है, और कॉर्पोरेट नेटवर्क इसे एक सोशल नेटवर्क के रूप में काटते हैं। आवश्यक क्षेत्र में स्थिर आउटबाउंड नोड बुनियादी ढांचे की उपलब्धता का प्रश्न है, न कि सीमाओं को दरकिनार करने का। सर्वर कार्यों के लिए स्थायी IP के साथ आमतौर पर डेटा सेंटर प्रॉक्सी पर्याप्त होती है।
  • क्षेत्रीय वितरण। Reddit कुछ सामग्री और सिफारिशों को अनुरोध की भूगोल के अनुसार देता है; यदि आप विश्लेषण कर रहे हैं कि किसी विशेष देश का दर्शक क्या देखता है, तो आपको उसी से बाहर निकलने की आवश्यकता है।
  • संरचना का विभाजन। जब कई स्वतंत्र सेवाएँ (संग्रह, उल्लेखों की निगरानी, विश्लेषण) एक ही सर्वर पर रहती हैं, तो एकमात्र IP सभी एकीकरणों के लिए एक सामान्य विफलता बिंदु बन जाता है।
  • अपने खातों के साथ काम करना। मॉडरेशन, समुदायों का प्रबंधन और कई प्रोफाइल के साथ वैध SMM गतिविधि के लिए "खाता ↔ स्थायी IP" संयोजन — बुनियादी स्वच्छता है। यहाँ रिहायशी प्रॉक्सी sticky सत्र के साथ उपयुक्त हैं।

लेकिन प्रॉक्सी क्या नहीं करेंगी: वे अनुबंध को दरकिनार करते हुए व्यावसायिक संग्रह को वैध नहीं करेंगी, 1000 आइटम की लिस्टिंग-कैप को नहीं हटाएँगी और Disallow: / को robots.txt में रद्द नहीं करेंगी। प्लेटफार्मों के साथ सीमाओं के काम के लिए सामान्य दृष्टिकोण API में दर सीमांकन और प्रॉक्सी की भूमिका पर विश्लेषण में है।

निष्कर्ष

2026 में Reddit ने "खुले डेटासेट, जिसे .json के माध्यम से लिया जा सकता है" के रूप में पूरी तरह से बंद कर दिया। कार्यशील योजना इस प्रकार है: आधिकारिक OAuth पहुंच + शीर्षकों पर ईमानदार लिमिटर + नियमों के भीतर टोकनों का रोटेशन + इतिहास के लिए बाहरी इंडेक्स. इस योजना में प्रॉक्सी उपलब्धता और भूगोल के लिए जिम्मेदार हैं, न कि कोटा को दरकिनार करने के लिए — और यही एकमात्र भूमिका है, जिसमें वे पूर्वानुमानित परिणाम देते हैं।

यदि आपका प्रोजेक्ट व्यावसायिक है, तो Reddit के साथ अनुबंध के लिए बजट की योजना पहले से बनाएं: Perplexity, Oxylabs और SerpApi के साथ कानूनी इतिहास दिखाता है कि प्लेटफार्म अपने डेटा की सुरक्षा पर कानूनी पहुंच की लागत से काफी अधिक खर्च करने के लिए तैयार है।

```