13 सितंबर 2026 को Have I Been Pwned पर एक रिकॉर्ड Chess.com (2026) आया: 7.3 मिलियन पंक्तियाँ, 4.6 मिलियन अद्वितीय ईमेल पते। डंप में पासवर्ड नहीं हैं, हैश नहीं हैं, भुगतान डेटा नहीं है। और ऐसा लगता है कि हैकिंग भी नहीं हुई: डेटा को नौ दिनों तक सामान्य अनुरोधों के माध्यम से एक सक्रिय सेवा से इकट्ठा किया गया। यह वह स्थिति है जब "लीक" और "सिस्टम में घुसपैठ" अलग चीजें हैं, और समझने के लिए वास्तव में तंत्र में जाना चाहिए।
क्या वास्तव में सार्वजनिक रूप से उपलब्ध हुआ
आर्काइव 12 अगस्त 2026 को एक साइबर अपराध मंच पर आया और टेलीग्राम के माध्यम से फैल गया। अनज़िप की गई फ़ाइल का आकार 15.5 जीबी (744 एमबी 7-Zip में) है, जिसमें 7,337,395 रिकॉर्ड हैं, प्रत्येक में 38 फ़ील्ड हैं।
- ईमेल पते — लगभग 75% रिकॉर्ड में (4.6 मिलियन अद्वितीय)।
- उपयोगकर्ता नाम, असली नाम, उपयोगकर्ता आईडी और UUID।
- देश, स्थान, इंटरफेस की भाषा।
- रेटिंग, उपाधियाँ, खेल का स्तर, प्रीमियम सदस्यता की स्थिति।
- पंजीकरण और अंतिम लॉगिन की तिथियाँ — अगस्त 2026 तक।
- गूगल एड मैनेजर के विज्ञापन खंड — फ़ील्ड gam_audiences और audiences_member_of।
अंतिम बिंदु सबसे अप्रत्याशित है। ये आंतरिक मार्केटिंग लेबल हैं जैसे "परीक्षण अवधि के लिए उपयुक्त", "छोड़ने वाला उपयोगकर्ता", रेटिंग रेंज, कोचिंग सुझावों के प्रयोग में भागीदारी। उपयोगकर्ता के लिए ये अदृश्य हैं, सार्वजनिक API में नहीं हैं, "अपने खंड को देखने और सुधारने" का कोई सेटिंग नहीं है। यानी डंप में न केवल प्रोफ़ाइल आई है, बल्कि यह भी कि प्लेटफ़ॉर्म खुद विज्ञापन के लिए खिलाड़ी को कैसे टैग करता है।
यह स्क्रैपिंग क्यों है, न कि हैकिंग: तीन सबूत
डंप का विश्लेषण करने वाले विश्लेषक विक्रेता के शब्दों पर नहीं, बल्कि डेटा की संरचना पर आधारित थे।
- संग्रह की गति। रिकॉर्ड नौ दिनों तक की तारीखों के साथ हैं — 26 जुलाई से 3 अगस्त 2026 तक, असमान बैचों में 72 से 267 हजार प्रति दिन। एक साथ डेटाबेस का निर्यात ऐसा नहीं दिखता: एक समझौता किए गए स्टोरेज से डंप — यह एक क्षण में एक कट है।
- डुप्लिकेट। 7.4% रिकॉर्ड में दोहराव है: एक ही खाता विभिन्न दिनों में निर्यात में आया। यह एक स्वचालित स्कैनिंग का संकेत है, न कि तालिका का निर्यात।
- पहली संस्करण का UUID। Chess.com के पहचानकर्ता में अंतर्निहित समय स्टाम्प होता है। चयन की जांच से पता चला: 169,287 में से 169,289 UUID ने खाता पंजीकरण की तारीख के साथ तीन सेकंड की सटीकता के साथ मेल खाया। लाखों रिकॉर्ड में इस प्रकार की सहसंबंध को बनाना असंभव है — डेटा असली हैं, लेकिन वैध रूप से अनुरोधों के माध्यम से प्राप्त किए गए हैं।
HIBP ने एक और तर्क जोड़ा: डंप में 99% ईमेल पते पहले की लीक में पहले ही देखे जा चुके हैं। एक उत्पादन से सीधे उठाए गए डेटाबेस के लिए, अनुपात अलग होता — यहाँ स्पष्ट है कि पते बाहरी स्रोत से आए हैं और संबंधित किए गए हैं।
तंत्र: "दोस्तों को खोजें" फ़ंक्शन एक खोज इंडेक्स के रूप में
वेक्टर 2023 के घटना से भी जाना जाता है, जब Chess.com से पहले 828 हजार, और फिर लगभग 476 हजार रिकॉर्ड समान फ़ील्ड संरचना के साथ लीक हुए। तब कंपनी ने स्पष्ट रूप से कहा: "यह डेटा लीक नहीं है। हमारी अवसंरचना, खाते और पासवर्ड जैसे डेटा सुरक्षित हैं।" औपचारिक रूप से — यह सच है।
स्कीमा सरल है। प्लेटफ़ॉर्म में परिचितों की खोज करने का फ़ंक्शन है: आप एक ईमेल पता अपलोड करते हैं, सेवा जवाब देती है कि क्या ऐसा उपयोगकर्ता है, और उसका प्रोफ़ाइल दिखाती है। हम एक बाहरी ईमेल डेटाबेस लेते हैं (उनकी खुली पहुंच में अरबों हैं — यहीं से पिछले लीक के साथ 99% मेल खाता है), इसे इस फ़ंक्शन के माध्यम से चलाते हैं और एक समृद्ध प्रोफ़ाइल प्राप्त करते हैं: नाम, देश, रेटिंग, अंतिम लॉगिन की तारीख, विज्ञापन खंड।
यहाँ कोई एकल ऑपरेशन हमले के रूप में नहीं दिखता। यह लाखों पुनरावृत्तियों पर हमले में बदल जाता है। डंप का विश्लेषण करने वाले विशेषज्ञों ने सीधे जिम्मेदार को नामित किया: कम आंका गया enumeration resistance, गति की सीमा और धीमी चौड़ी स्कैनिंग की निगरानी। यानी हैकिंग से सुरक्षा है, लेकिन धैर्यपूर्वक स्कैनिंग से नहीं।
यह एक एकल मामला नहीं है — यह समस्याओं का एक वर्ग है
इसी वर्ग का सबसे बड़ा प्रदर्शन — व्हाट्सएप पर वियना विश्वविद्यालय का अध्ययन। टीम ने संपर्क खोज API के रिवर्स इंजीनियरिंग के माध्यम से प्रति घंटे 100 मिलियन से अधिक फोन नंबरों का सर्वेक्षण किया, एक विश्वविद्यालय सर्वर और पांच प्रमाणित खातों का उपयोग करते हुए। परिणाम — 3.5 बिलियन सक्रिय खातों की सूची: नंबर, प्रोफ़ाइल तस्वीरें, सार्वजनिक कुंजी। गति की सीमा एक बार भी काम नहीं की। प्रयोग दिसंबर 2024 से अप्रैल 2025 तक चला, मेटा ने अक्टूबर 2025 में चुपचाप छिद्र बंद कर दिया, और काम को NDSS 2026 में प्रस्तुत किया।
उसी अध्ययन का एक महत्वपूर्ण विवरण: 2021 के पुराने फेसबुक लीक से 58% फोन नंबर अभी भी व्हाट्सएप पर सक्रिय थे। एक बार एकत्र किए गए डेटा पुराना नहीं होता — वे अगले स्कैन के लिए इनपुट सामग्री बन जाते हैं। Chess.com 2026 में ठीक इसी से प्रभावित हुआ: इसे किसी और द्वारा पहले से एकत्रित सूची से लक्षित किया गया।
यह डेटा को वैध रूप से इकट्ठा करने वालों के लिए क्या बदलता है
हर ऐसा घटना न केवल अपराधी को प्रभावित करती है, बल्कि सभी को जो सार्वजनिक डेटा के साथ काम करते हैं। प्लेटफार्मों की प्रतिक्रिया पूर्वानुमानित है: सार्वजनिकता के बाद सीमाएँ कड़ी हो जाती हैं, व्यवहार विश्लेषण लागू किया जाता है, खोज और खोज के एंडपॉइंट्स को प्रमाणीकरण और कैप्चा के पीछे छिपा दिया जाता है। आपका सटीक सार्वजनिक उत्पाद कार्ड पार्सर ईमेल स्कैनिंग से संबंधित नहीं है — लेकिन नए नियम के तहत यह सभी के साथ आएगा। इस समस्या के सामान्य दृष्टिकोण पर हमने API सीमाओं और उनके साथ काम करने के विश्लेषण में लिखा।
इसलिए सीमा को स्पष्ट रूप से बनाए रखना महत्वपूर्ण है — यह तकनीक के माध्यम से नहीं, बल्कि इस बात पर निर्भर करती है कि आप लोगों के पहचानकर्ताओं के साथ क्या करते हैं।
- सार्वजनिक डेटा — वह जो सेवा एक अनाम आगंतुक को सीधे लिंक के माध्यम से दिखाती है: उत्पाद कार्ड, मूल्य, सार्वजनिक प्रोफ़ाइल, खुला पोस्ट। इकट्ठा करना सामान्य है।
- Enumeration — खोज फ़ंक्शन में बाहरी ईमेल, फोन या आईडी की सूची को डालना, यह जानने के लिए कि वे किसके हैं। यह अब सार्वजनिक डेटा का संग्रह नहीं है, बल्कि व्यक्तिगत पहचानकर्ताओं का मिलान है, और GDPR जैसी न्यायालयों में इसे उचित रूप से वर्गीकृत किया जाता है — चाहे एंडपॉइंट खुला हो।
- छिपे हुए फ़ील्ड। Chess.com के विज्ञापन खंड किसी भी रूप में सार्वजनिक नहीं थे। यदि API से आने वाले उत्तर में वह है जो इंटरफेस में नहीं है, तो यह "बोनस" नहीं है, बल्कि रुकने का संकेत है।
ईमानदारी से डेटा संग्रह के लिए व्यावहारिक चेकलिस्ट: खोज और खोज फ़ंक्शन में दूसरों के संपर्क विवरण का उपयोग न करें; उस गति को बनाए रखें जिसे सेवा बिना गिरावट के सहन कर सकती है; robots.txt और सार्वजनिक प्रस्ताव का सम्मान करें; केवल वही फ़ील्ड लें जो इंटरफेस में दिखाई देते हैं; अधिक न रखें। इस मुद्दे के कानूनी पक्ष पर हमने विस्तार से चर्चा की है कैसे कानूनी रूप से डेटा एकत्रित करें प्रॉक्सी के माध्यम से।
यदि आपका पता इस डंप में है तो क्या करें
निर्यात में पासवर्ड नहीं हैं, इसलिए केवल तथ्य के लिए पासवर्ड बदलने का कोई मतलब नहीं है — लेकिन जोखिम शून्य नहीं है, और यह विशिष्ट है।
- Have I Been Pwned में पता जांचें। रिकॉर्ड का नाम Chess.com (2026) है, 13 सितंबर 2026 को अपलोड किया गया, 4.6 मिलियन पते।
- लक्षित फ़िशिंग की प्रतीक्षा करें। "ईमेल + असली नाम + देश + रेटिंग + अंतिम लॉगिन की तारीख + सदस्यता की स्थिति" का संयोजन — प्लेटफ़ॉर्म से कथित पत्र के लिए एक विश्वसनीय सामग्री है। सामान्य मेलिंग ऐसा नहीं दिखता; पत्र जो आपकी रेटिंग जानता है, ऐसा दिखता है।
- जांचें कि इस पते का और कहाँ उपयोग किया गया है। 99% पते पहले की लीक में पहले ही देखे जा चुके हैं — इसका मतलब है कि आपका ईमेल लंबे समय से दूसरों की सूचियों में है और अगले प्लेटफॉर्म पर खुले खोज फ़ंक्शन के माध्यम से चलाया जाएगा।
- जहाँ संभव हो, ईमेल को सार्वजनिक प्रोफ़ाइल से अलग करें। यदि सेवा आपको ईमेल या फोन द्वारा अपने आप को खोजने से रोकने की अनुमति देती है — तो यह वही स्विच है जो आपके लिए वर्णित वेक्टर को व्यक्तिगत रूप से बंद कर देता है।
जो लोग अपनी सेवा का निर्माण कर रहे हैं, उनके लिए इस घटना से संक्षिप्त निष्कर्ष और भी सरल है: कोई भी फ़ंक्शन जो बाहरी पहचानकर्ता के माध्यम से "ऐसा उपयोगकर्ता है, यहाँ उसका कार्ड है" का उत्तर देता है — यह आपकी डेटाबेस पर एक खोज इंडेक्स है, जो बाहर उपलब्ध है। इसे खाते और IP उप-नेट पर गति की सीमा की आवश्यकता है, न कि केवल एक पते पर, साथ ही चौड़ी धीमी चयन की निगरानी की आवश्यकता है, जो प्रति घंटे की मेट्रिक्स में सामान्य पृष्ठभूमि के रूप में दिखती है।
प्रॉक्सी की भूमिका — और यह निश्चित रूप से क्या नहीं है
यह स्पष्ट रूप से कहना महत्वपूर्ण है, क्योंकि हर ऐसे घटना के बाद "यह सब प्रॉक्सी के माध्यम से किया जाता है" का तर्क उभरता है। प्रॉक्सी तीन कार्यों को हल करती हैं: IP पते की प्रतिष्ठा और ASN, अनुरोध की भूगोलिक स्थिति, लोड का वितरण, ताकि एक पते पर कानूनी संग्रह के दौरान सीमा न टूटे। रेसिडेंशियल प्रॉक्सी की आवश्यकता होती है जहाँ साइट क्षेत्र के अनुसार विभिन्न सामग्री प्रदान करती है या डेटा सेंटर उप-नेट्स को काटती है, — उदाहरण के लिए, कीमतों की निगरानी और विभिन्न देशों में परिणामों के लिए।
प्रॉक्सी क्या नहीं करती हैं — यह दूसरों के ईमेल के स्कैनिंग को कानूनी संग्रह में नहीं बदलती और परिणामों से सुरक्षा नहीं करती। Chess.com के मामले में, पते के बीच वितरण ने शायद डेटा को नौ दिनों तक बिना देखे खींचने की अनुमति दी, लेकिन यह प्लेटफ़ॉर्म की कमजोर सुरक्षा की विशेषता है, न कि इस प्रकार के परिदृश्य के पक्ष में एक तर्क। तकनीकी रूप से enumeration सामान्य ट्रैफ़िक से अलग नहीं है जब तक कि कोई मात्रा को लॉग के साथ मेल नहीं खाता — और फिर बात सीमाओं के बारे में नहीं, बल्कि नियामक के बारे में शुरू होती है।
निष्कर्ष
Chess.com की कहानी तीन वर्षों में एक ही हमले की सतह के साथ तीसरा एपिसोड है और बिना किसी हैक के। प्लेटफार्मों के लिए निष्कर्ष कठोर है: सुरक्षा का ढांचा जो केवल अवसंरचना में घुसपैठ को घटना मानता है, यह नहीं देखता कि डेटाबेस को भागों में कैसे निकाला जाता है। जो लोग पेशेवर रूप से डेटा एकत्र करते हैं, उनके लिए भी व्यावहारिक है: सीमाएँ मूल्य निर्धारण स्कैनरों के कारण नहीं कड़ी होती हैं, बल्कि ऐसे मामलों के कारण होती हैं, और प्रत्येक नई लहर की कीमत डेटा संग्रह उद्योग पर पड़ती है। सार्वजनिक संग्रह और व्यक्तिगत पहचानकर्ताओं के स्कैनिंग को अलग करना — यह शिष्टाचार के बारे में नहीं है, यह इस बारे में है कि क्या सार्वजनिक डेटा वास्तव में उपलब्ध रहेगा।
