Il 31 luglio 2026, il giudice federale Paul Engelmayer (Distretto meridionale di New York) ha rifiutato di archiviare la causa di Reddit contro Perplexity AI e l'aggregatore di risultati di ricerca SerpApi. Le principali accuse relative alla legge anti-bypass DMCA § 1201(a) sono state confermate — il caso prosegue. Undici giorni prima, un altro giudice federale, nel Nord della California, aveva cestinato una causa quasi identica di Google contro lo stesso SerpApi. Stesso ostacolo tecnico, stesso convenuto — e due esiti opposti.
Non si tratta di una contraddizione tra i tribunali. È un chiaro segnale su dove passa realmente il confine legale nello scraping del 2026. E non passa dove gli ingegneri sono abituati a cercarlo.
Cosa ha deciso il tribunale il 31 luglio
Il caso Reddit, Inc. v. SerpApi LLC et al. (n. 1:25-cv-08736) è stato presentato da Reddit il 22 ottobre 2025 e nel febbraio 2026 ha ampliato la denuncia. Ci sono quattro convenuti, e la composizione è importante: l'azienda AI Perplexity AI, l'aggregatore di risultati SerpApi e due fornitori di proxy — Oxylabs UAB e AWMProxy.
La logica dell'accusa è la seguente: gli intermediari hanno estratto contenuti di Reddit su larga scala non dai server di Reddit stesso, ma dai risultati di ricerca di Google, mascherando la loro origine per eludere la protezione; Perplexity acquistava questi dati e li utilizzava nel suo motore AI.
Il giudice Engelmayer ha suddiviso le accuse:
- Confermata: l'accusa principale ai sensi del DMCA § 1201(a) — elusione della misura tecnica di controllo degli accessi. Il tribunale ha riconosciuto che il meccanismo di protezione Google SearchGuard si qualifica come misura di controllo degli accessi ai sensi della legge, e Reddit si trova "nella zona di interesse" delle norme anti-bypass del DMCA. Secondo la formulazione del giudice, la piattaforma "incarna il mercato digitale globale delle opere protette", per lo sviluppo del quale è stato adottato il DMCA.
- Respinta: l'accusa di "trafficking" ai sensi del § 1201(b) contro SerpApi, così come le denunce di concorrenza sleale e arricchimento senza causa contro entrambi i convenuti.
Importante precisazione: questa decisione riguarda una mozione per archiviare la causa, non un verdetto sul merito. Il tribunale ha solo affermato che il caso ha il diritto di proseguire fino all'udienza. Ma è proprio in questa fase che di solito muoiono le cause deboli contro gli scraper — questa non è morta.
Perché Google ha perso, mentre Reddit ha superato il filtro
Il 20 luglio 2026, il giudice presiedente Yvonne Gonzalez Rogers nel Nord della California ha respinto la causa di Google contro SerpApi ai sensi del DMCA — senza diritto di ripresentazione nella forma precedente. Abbiamo analizzato in dettaglio questa decisione: il tribunale ha concordato che la sostituzione dei fingerprint del browser, la rotazione degli IP e la risoluzione dei captcha sono tecnicamente un bypass, ma il bypass in sé non è illegale, se dietro l'ostacolo non ci sono opere protette da copyright.
Google ha inciampato proprio su questo. L'azienda non ha affermato che i risultati della sua ricerca sono protetti dalla legge sul copyright e non ha dimostrato di aver implementato SearchGuard "con il permesso del titolare dei diritti", come richiesto dal 17 U.S.C. § 1201(a)(3)(B). L'ostacolo proteggeva il ricavo pubblicitario — e il DMCA protegge non il ricavo, ma il copyright.
Reddit è entrato da un'altra parte. Dietro lo stesso SearchGuard, secondo Reddit, non ci sono "risultati piatti e irrilevanti", ma post degli utenti — testi di persone reali, i cui diritti Reddit licenzia, anche attraverso transazioni monetarie con Google e OpenAI. La differenza non sta nella tecnica di bypass. La differenza sta in cosa si trova dietro l'ostacolo.
La conclusione che ingegneri e proprietari di dati devono tenere a mente: l'identità tecnica delle azioni non implica l'identità legale delle conseguenze. Lo stesso script con rotazione di IP residenziali in un caso — è lavoro legittimo con fatti pubblici, in un altro — è elusione della protezione di un'opera protetta.
Dove si collocano i proxy in questo caso
Per il nostro settore, la cosa più interessante nel caso non è Perplexity, ma i due altri nomi nella lista dei convenuti. Oxylabs e AWMProxy sono stati coinvolti non come testimoni e non come "strumento di terze parti", ma come co-convenuti: l'attore ritiene che l'infrastruttura di anonimizzazione fosse parte dello schema di elusione.
Il ricorso di Oxylabs per archiviare la causa è stato sospeso dal tribunale — a causa della sostanziale sovrapposizione dei suoi argomenti con le argomentazioni di SerpApi e Perplexity, il briefing è stato congelato fino alla risoluzione delle mozioni dei co-convenuti. Queste mozioni sono ora state risolte, e la teoria anti-bypass di base è sopravvissuta. Ciò significa che il turno è arrivato al fornitore di proxy, e si presenta in una posizione di negoziazione notevolmente peggiore rispetto a sei mesi fa.
Altri due dettagli dai materiali del caso, che dicono molto sulla scala e sui metodi di prova:
- Secondo i dati ottenuti tramite richiesta giudiziaria, SerpApi ha fatto riferimento a circa 1,8 miliardi di pagine di risultati di ricerca di Google contenenti dati di Reddit in due settimane di luglio 2025.
- Reddit ha applicato una classica trappola: ha pubblicato contenuti visibili solo al crawler di Google, e poi li ha trovati nelle risposte di Perplexity. Questo è il tipo di prova che trasforma l'astratto "loro prendono dati da qualche parte" in una catena di fornitura concreta.
Il trucco della "esca avvelenata" vale la pena di essere ricordato anche per un'altra ragione. Mostra che le grandi piattaforme hanno da tempo smesso di bloccare e hanno iniziato a raccogliere prove: contenuti contrassegnati, pagine honeypot, snippet unici. La vostra accuratezza a livello di rete non salva, se il contenuto è già contrassegnato.
Punti deboli della causa, di cui si parla raramente
Reddit ha superato il primo filtro, ma la sua posizione non è affatto impeccabile, e la difesa colpisce due punti dolenti.
Primo — chi possiede effettivamente i post. Il contratto utente di Reddit lascia i diritti sulle pubblicazioni agli autori, mentre alla piattaforma spetta una licenza non esclusiva. SerpApi sostiene che questa frattura è "fatale per ogni punto" della denuncia: non si può proteggere per copyright ciò di cui non si possiede. Lo stesso argomento contro Google non ha funzionato affatto — lì la disputa riguardava i propri risultati.
Secondo — la proteggibilità di esempi specifici. Nella denuncia ampliata, Reddit ha fornito campioni di materiale che considera di sua proprietà: un frammento della politica sulla privacy, un elenco di film, la data e l'indirizzo di un club jazz. La difesa risponde ragionevolmente che elenchi, fatti e brevi frammenti non raggiungono la soglia di protezione. Inoltre, un argomento separato: SearchGuard non è una "misura efficace di controllo degli accessi", poiché una persona lo supera senza problemi — un percorso di accesso rimane sempre aperto.
Questi argomenti non sono scomparsi — sono semplicemente stati rinviati alla fase di merito. Quindi "Reddit ha vinto" è una forte semplificazione. È più corretto dire: la teoria anti-bypass contro gli scraper e i compratori di dati ha ottenuto il diritto di esistere nel tribunale di New York. Negli Stati Uniti, la decisione di un distretto non vincola un altro, e stiamo assistendo a una frattura della pratica in tempo reale.
Cosa significa praticamente
Se raccogliete dati per affari, dalla decisione del 31 luglio seguono cose piuttosto concrete.
- Valutate non l'ostacolo, ma il contenuto dietro di esso. Eludere un captcha su una pagina con prezzi, orari o indirizzi — è una storia di rischio. Eludere lo stesso ostacolo per testi, foto e recensioni, i cui diritti appartengono a qualcuno — è fondamentalmente un'altra cosa. L'esposizione legale è determinata dall'oggetto, non dallo strumento.
- Il compratore di dati non è più al sicuro. Perplexity ha costruito la sua difesa sul fatto di essere solo un acquirente finale e "riassumere discussioni pubbliche". Il tribunale non ha ritenuto questo argomento sufficiente per archiviare il caso. Questo è un segnale diretto a tutti coloro che acquistano set di dati pronti: l'origine dei dati dovrà essere spiegata.
- Contratto e ToS vivono separati dal DMCA. Anche dove la teoria del copyright si sgretola, rimane la violazione dei termini di utilizzo come base autonoma. La sconfitta della piattaforma ai sensi del DMCA non significa che lo scraping sia "autorizzato dal tribunale".
- Lo strato infrastrutturale è diventato visibile per gli attori. Quando i fornitori di proxy diventano co-convenuti, la domanda "cosa sa e registra il mio fornitore sul mio traffico" smette di essere paranoica. Scegliete un fornitore con fonti chiare del pool, una politica di utilizzo accettabile chiara e KYC — è esattamente quella parte noiosa della burocrazia che distingue un partner infrastrutturale da un partecipante a uno schema altrui. Di criteri abbiamo scritto nell'analisi delle pratiche legali di raccolta dati tramite proxy.
- Separate le attività in base al livello di rischio. Monitoraggio dei prezzi, verifica dei risultati, controllo della disponibilità delle proprie risorse e test geo — scenari tipici con un profilo legale prevedibile; per questi sono adatti proxy residenziali o indirizzi datacenter economici, se la piattaforma non richiede origine "residenziale". L'estrazione di massa di contenuti protetti da copyright per addestrare modelli — è uno scenario che ora si sta trasferendo nelle aule di tribunale, e deve essere affrontato con una licenza, non con la rotazione degli IP.
In breve
Due tribunali federali in undici giorni hanno divergenze nella valutazione dello stesso bypass dello stesso ostacolo. California: bypass della protezione di ricerca senza copyright dietro di essa — non violazione del DMCA. New York: se dietro l'ostacolo si trova contenuto utente protetto, l'accusa anti-bypass ha diritto di essere esaminata, insieme alle accuse contro gli intermediari e il compratore di dati.
Per coloro che lavorano con i dati professionalmente, la conclusione è una: il lato tecnico della raccolta non è più il principale fattore di rischio. La questione principale riguarda i diritti su ciò che si sta prelevando e la trasparenza della catena attraverso la quale questi dati sono arrivati a voi. La prossima tappa nel caso è la mozione di Oxylabs, che il tribunale ha riattivato dopo la decisione sui co-convenuti.
