Torna al blog

Fuga di Chess.com da 7,3 milioni: nove giorni di tentativi invece di un hack

7,3 milioni di profili Chess.com, 4,6 milioni di email e segmenti pubblicitari nascosti sono stati resi accessibili al pubblico — senza alcun hack. I dati sono stati raccolti per nove giorni consecutivi, sostituendo le basi email altrui nella funzione di ricerca amici. Analizziamo come si distingue lo scraping dall'hacking tramite UUID e il ritmo di estrazione, e dove passa il confine tra la raccolta di dati pubblici e la scansione di identificatori personali.

📅14 settembre 2026
Fuga di Chess.com da 7,3 milioni: nove giorni di tentativi invece di un hack

Il 13 settembre 2026, su Have I Been Pwned è apparsa una registrazione Chess.com (2026): 7,3 milioni di righe, 4,6 milioni di indirizzi email unici. Non ci sono password nel dump, nessun hash, nessun dato di pagamento. E a quanto pare non c'è stata nemmeno una violazione: i dati sono stati raccolti per nove giorni consecutivi tramite normali richieste al servizio attivo. Questo è un caso in cui "perdita" e "intrusione nel sistema" sono cose diverse, e vale la pena approfondire la meccanica.

Cosa è stato reso pubblico

L'archivio è apparso su un forum di cybercriminali il 12 agosto 2026 ed è stato diffuso tramite Telegram. Il file estratto pesa 15,5 GB (744 MB in 7-Zip), contenente 7.337.395 registrazioni con 38 campi ciascuna.

  • Indirizzi email — circa il 75% delle registrazioni (4,6 milioni unici).
  • Nomi utente, nomi reali, user ID e UUID.
  • Paese, posizione, lingua dell'interfaccia.
  • Valutazioni, titoli, livello di gioco, stato dell'abbonamento premium.
  • Data di registrazione e ultimo accesso — fino ad agosto 2026.
  • Segmenti pubblicitari di Google Ad Manager — campi gam_audiences e audiences_member_of.

L'ultimo punto è il più inaspettato. Si tratta di etichette di marketing interne come "adatto per il periodo di prova", "utente disattivato", intervalli di valutazione, partecipazione a esperimenti con suggerimenti per i giocatori. Non sono visibili all'utente, non ci sono nell'API pubblica, non esiste un'impostazione per "visualizzare e correggere il proprio segmento". Quindi nel dump è finito non solo il profilo, ma anche come la piattaforma stessa etichetta il giocatore per la pubblicità.

Perché si tratta di scraping e non di hacking: tre prove

Gli analisti che hanno esaminato il dump si sono basati non sulle parole del venditore, ma sulla struttura dei dati.

  1. Ritmo di raccolta. Le registrazioni sono datate per nove giorni consecutivi — dal 26 luglio al 3 agosto 2026, in lotti irregolari da 72 a 267 mila al giorno. L'esportazione simultanea del database non appare in questo modo: un dump da un archivio compromesso è un'istantanea in un momento specifico.
  2. Duplicati. Il 7,4% delle registrazioni si ripete: lo stesso account è apparso nel dump in giorni diversi. Questo è un segno di un'operazione automatizzata con una finestra mobile, non di un'esportazione di tabella.
  3. UUID della prima versione. Gli identificatori di Chess.com contengono un timestamp incorporato. Il controllo del campione ha mostrato che 169.287 su 169.289 UUID corrispondevano alla data di registrazione dell'account con un'accuratezza di tre secondi. Falsificare tale correlazione su milioni di registrazioni è impossibile: i dati sono autentici, ma ottenuti tramite richieste legali.

In HIBP è stato aggiunto un ulteriore argomento: il 99% degli indirizzi email nel dump era già apparso in precedenti perdite. Per un database estratto direttamente dalla produzione, la percentuale sarebbe stata diversa — qui è chiaro che gli indirizzi provengono dall'esterno e sono stati confrontati con gli account.

Meccanica: la funzione "trova amici" come indice di ricerca

Il vettore è noto anche per l'incidente del 2023, quando da Chess.com sono trapelati inizialmente 828 mila e poi circa 476 mila registrazioni con una struttura di campi identica. Allora la società ha dichiarato esplicitamente: "Questa NON è una perdita di dati. La nostra infrastruttura, gli account e i dati come le password sono al sicuro". Formalmente, è vero.

Lo schema è semplice. La piattaforma ha una funzione di ricerca di amici: carichi un indirizzo email, il servizio risponde se esiste un tale utente e mostra il suo profilo. Prendiamo un database di email estraneo (ce ne sono miliardi di accesso pubblico — da qui i famosi 99% di corrispondenze con perdite passate), lo facciamo passare attraverso questa funzione e otteniamo un profilo arricchito: nome, paese, valutazione, data dell'ultimo accesso, segmento pubblicitario.

Nessuna operazione singola qui appare come un attacco. Diventa un attacco su milioni di ripetizioni. Gli esperti che hanno esaminato il dump hanno indicato il colpevole: la sottovalutazione della resistenza all'enumerazione, limitazione della velocità e monitoraggio di raccolte lente e ampie. Quindi c'è protezione contro l'hacking, ma non contro la paziente enumerazione.

Non è un caso isolato — è una classe di problemi

La dimostrazione più grande della stessa classe è lo studio dell'Università di Vienna su WhatsApp. Il team, attraverso il reverse engineering dell'API di discovery dei contatti, ha interrogato oltre 100 milioni di numeri di telefono all'ora, utilizzando un server universitario e cinque account autenticati. Risultato — elencati 3,5 miliardi di account attivi: numeri, foto dei profili, chiavi pubbliche. La limitazione della velocità non ha funzionato nemmeno una volta. L'esperimento è andato avanti da dicembre 2024 ad aprile 2025, Meta ha silenziosamente chiuso la falla nell'ottobre 2025, il lavoro è stato presentato a NDSS 2026.

Un dettaglio significativo dello stesso studio: il 58% dei numeri di telefono della vecchia perdita di Facebook del 2021 era ancora attivo su WhatsApp. I dati raccolti una volta non invecchiano — diventano materiale di ingresso per la successiva enumerazione. Chess.com nel 2026 ha subito esattamente questo: è stato attaccato con un elenco raccolto da qualcun altro in precedenza.

Cosa cambia per chi raccoglie dati legalmente

Ogni incidente di questo tipo colpisce non il malintenzionato, ma tutti coloro che lavorano con dati pubblici. La reazione delle piattaforme è prevedibile: dopo la divulgazione, vengono inaspriti i limiti, viene implementata l'analisi comportamentale, gli endpoint di ricerca e discovery vengono nascosti dietro autorizzazione e captcha. Il tuo accurato parser di schede prodotto pubbliche non ha nulla a che fare con l'enumerazione di email — ma sarà soggetto alla nuova regola insieme a tutti gli altri. Abbiamo scritto sugli approcci generali a questo problema nell'analisi dei limiti API e del loro utilizzo.

Quindi è importante mantenere chiaramente il confine — esso non passa per la tecnica, ma per ciò che fai con gli identificatori delle persone.

  • Dati pubblici — ciò che il servizio mostra a un visitatore anonimo tramite un link diretto: scheda prodotto, prezzo, profilo pubblico, post aperto. Raccogliere è normale.
  • Enumeration — inserimento di un elenco esterno di email, numeri di telefono o ID in una funzione di ricerca per scoprire a chi appartengono. Questo non è più raccolta di dati pubblici, ma corrispondenza di identificatori personali, e nelle giurisdizioni con regimi simili al GDPR viene qualificato di conseguenza — indipendentemente dal fatto che l'endpoint sia aperto.
  • Campi nascosti. I segmenti pubblicitari di Chess.com non erano pubblici in alcuna forma. Se dalla risposta dell'API arriva qualcosa che non è presente nell'interfaccia, non è un "bonus", ma un segnale per fermarsi.

Un pratico checklist per la raccolta diligente: non inserire dati di contatto estranei nelle funzioni di ricerca e discovery; mantenere un ritmo che il servizio può sostenere senza degradazione; rispettare robots.txt e l'offerta pubblica; raccogliere solo i campi visibili nell'interfaccia; non conservare dati superflui. Abbiamo esaminato a fondo l'aspetto legale della questione nel materiale su come raccogliere dati legalmente tramite proxy.

Cosa fare se il tuo indirizzo è in questo dump

Non ci sono password nel dump, quindi cambiare la password solo per il fatto di essere stati compromessi ha poco senso — ma il rischio non è nullo, ed è specifico.

  1. Controlla l'indirizzo su Have I Been Pwned. La registrazione si chiama Chess.com (2026), caricata il 13 settembre 2026, 4,6 milioni di indirizzi.
  2. Aspetta phishing mirato. La combinazione "email + nome reale + paese + valutazione + data dell'ultimo accesso + stato dell'abbonamento" è materiale pronto per una convincente email apparentemente dalla piattaforma. Una normale newsletter non appare in questo modo; un'email che conosce la tua valutazione appare.
  3. Controlla dove è stato utilizzato anche questo indirizzo. Il 99% degli indirizzi era già apparso in perdite precedenti — il che significa che la tua email è da tempo in elenchi estranei e sarà passata attraverso la prossima piattaforma con funzione di ricerca aperta.
  4. Disconnetti l'email dal profilo pubblico dove possibile. Se il servizio consente di vietare la ricerca di te tramite email o telefono — questo è esattamente l'interruttore che disattiva il vettore descritto per te.

Per chi costruisce il proprio servizio, la conclusione breve dall'incidente è ancora più semplice: qualsiasi funzione che risponde "c'è un tale utente, ecco il suo profilo" per un identificatore esterno è un indice di ricerca del tuo database, accessibile dall'esterno. Richiede limitazione della velocità per account e per subnet IP, e non solo per un singolo indirizzo, oltre a monitorare ampie raccolte lente, che nelle metriche orarie appaiono come un normale sfondo.

Il ruolo dei proxy — e cosa non è sicuramente

Vale la pena dirlo chiaramente, perché dopo ogni incidente di questo tipo riemerge il tema "tutto questo viene fatto tramite proxy". I proxy risolvono tre problemi: reputazione e ASN dell'indirizzo IP, geolocalizzazione della richiesta, distribuzione del carico per non superare il limite di un singolo indirizzo durante una raccolta legale. I proxy residenziali sono necessari dove il sito restituisce contenuti diversi a seconda della regione o taglia le subnet dei data center, ad esempio nel monitoraggio dei prezzi e dei risultati in diversi paesi.

Cosa non fanno i proxy — non trasformano l'enumerazione di email estranee in raccolta legittima e non proteggono dalle conseguenze. Nel caso di Chess.com, la distribuzione degli indirizzi ha probabilmente consentito di raccogliere dati per nove giorni senza essere notati, ma questa è una caratteristica di una protezione debole della piattaforma, non un argomento a favore di tale scenario. Tecnicamente, l'enumerazione non è distinguibile dal traffico normale fino al momento in cui qualcuno confronta il volume con i log — e poi inizia una conversazione non sui limiti, ma sul regolatore.

Conclusione

La storia di Chess.com è il terzo episodio in tre anni con la stessa superficie di attacco e senza un singolo hacking. Per le piattaforme, la conclusione è severa: un contorno di protezione che considera incidente solo l'intrusione nell'infrastruttura non vede come il database venga portato via a pezzi tramite una funzione legittima. Per chi raccoglie dati professionalmente, c'è anche una conclusione pratica: le restrizioni vengono inasprite non a causa dei parser di prezzi, ma a causa di storie come questa, e il costo di ogni nuova ondata ricade su tutta l'industria della raccolta dati. Separare la raccolta pubblica dall'enumerazione di identificatori personali non è una questione di etichetta, ma di se i dati pubblici rimarranno accessibili.