Le 31 juillet 2026, le juge fédéral Paul Engelmayer (district sud de New York) a refusé de rejeter la plainte de Reddit contre Perplexity AI et l'agrégateur de résultats de recherche SerpApi. Les principales allégations concernant l'article anti-contournement DMCA § 1201(a) ont été maintenues — l'affaire se poursuit. Onze jours auparavant, un autre juge fédéral, dans le district nord de Californie, avait jeté à la poubelle une plainte presque identique de Google contre le même SerpApi. Même barrière technique, même défendeur — et deux résultats opposés.
Ce n'est pas une contradiction entre les tribunaux. C'est un signal clair sur l'endroit où se situe réellement la frontière juridique en matière de scraping en 2026. Et elle ne se trouve pas là où les ingénieurs ont l'habitude de la chercher.
Que a décidé le tribunal le 31 juillet
L'affaire Reddit, Inc. v. SerpApi LLC et al. (n° 1:25-cv-08736) a été déposée par Reddit le 22 octobre 2025, et en février 2026, la plainte a été élargie. Il y a quatre défendeurs, et leur composition est importante : la société d'IA Perplexity AI, l'agrégateur de résultats SerpApi et deux fournisseurs de proxy — Oxylabs UAB et AWMProxy.
La logique de l'accusation est la suivante : les intermédiaires ont extrait du contenu de Reddit à grande échelle non pas depuis les serveurs de Reddit, mais à partir des résultats de recherche Google, masquant leur origine pour contourner la protection ; Perplexity achetait ces données et les fournissait à son moteur d'IA.
Le juge Engelmayer a séparé les allégations :
- Maintenu : l'allégation principale selon le DMCA § 1201(a) — contournement des mesures techniques de contrôle d'accès. Le tribunal a reconnu que le mécanisme de protection Google SearchGuard est qualifié de mesure de contrôle d'accès au sens de la loi, et que Reddit se trouve « dans la zone d'intérêt » des normes anti-contournement du DMCA. Selon la formulation du juge, la plateforme « incarne ce marché numérique mondial d'œuvres protégées », pour le développement duquel le DMCA a été adopté.
- Rejeté : l'allégation de « trafficking » selon le § 1201(b) contre SerpApi, ainsi que les plaintes pour concurrence déloyale et enrichissement sans cause contre les deux défendeurs.
Une importante réserve : cette décision concerne une motion pour rejeter la plainte, et non un verdict sur le fond. Le tribunal a simplement déclaré que l'affaire a le droit de se poursuivre jusqu'à l'audience. Mais c'est précisément à ce stade que les plaintes faibles contre les scrapers meurent généralement — celle-ci n'est pas morte.
Pourquoi Google a perdu, tandis que Reddit a passé le filtre
Le 20 juillet 2026, la juge présidente Yvonne Gonzalez Rogers dans le district nord de Californie a rejeté la plainte de Google contre SerpApi selon le DMCA — sans possibilité de réexamen dans sa forme précédente. Nous avons analysé cette décision en détail : le tribunal a convenu que la substitution d'empreintes de navigateur, la rotation d'IP et la résolution de CAPTCHA constituent techniquement un contournement, mais le contournement en soi n'est pas illégal si les œuvres protégées par le droit d'auteur ne se trouvent pas derrière la barrière.
Google a trébuché là-dessus. La société n'a pas affirmé que les résultats de sa recherche sont protégés par la loi sur le droit d'auteur, et n'a pas montré qu'elle avait mis en œuvre SearchGuard « avec l'autorisation du titulaire des droits », comme l'exige le 17 U.S.C. § 1201(a)(3)(B). La barrière protégeait les revenus publicitaires — et le DMCA protège non pas les revenus, mais le droit d'auteur.
Reddit a abordé la question sous un autre angle. Selon Reddit, derrière le même SearchGuard se trouvent non pas des « résultats plats et non pertinents », mais des publications d'utilisateurs — des textes de personnes réelles, dont Reddit détient les droits, y compris par le biais de transactions financières avec Google et OpenAI. La différence ne réside pas dans la technique de contournement. La différence réside dans ce qui se trouve derrière la barrière.
La conclusion à retenir pour les ingénieurs et les propriétaires de données : l'identité technique des actions ne signifie pas l'identité juridique des conséquences. Le même script avec rotation d'IP résidentielles dans une affaire — un travail légal avec des faits publics, dans une autre — un contournement de la protection d'une œuvre protégée.
Où se trouvent les proxies dans cette affaire
Pour notre secteur, ce qui est le plus intéressant dans cette affaire n'est pas Perplexity, mais les deux autres noms sur la liste des défendeurs. Oxylabs et AWMProxy sont impliqués non pas en tant que témoins et non pas en tant qu'« outils tiers », mais en tant que co-défendeurs : le plaignant considère que l'infrastructure d'anonymisation faisait partie du schéma de contournement.
La motion d'Oxylabs pour rejeter la plainte a été suspendue par le tribunal — en raison d'un chevauchement substantiel de ses arguments avec ceux de SerpApi et Perplexity, le briefing a été gelé jusqu'à la résolution des motions des co-défendeurs. Ces motions ont maintenant été résolues, et la théorie anti-contournement de base a survécu. Cela signifie que la question est arrivée au fournisseur de proxy, et il se présente à elle dans une position de négociation nettement moins favorable qu'il y a six mois.
Deux autres détails des documents de l'affaire, qui en disent long sur l'échelle et les méthodes de preuve :
- Selon les données obtenues par demande judiciaire, SerpApi a accédé à environ 1,8 milliard de pages de résultats de recherche Google contenant des données Reddit au cours de deux semaines de juillet 2025.
- Reddit a utilisé un piège classique : il a publié du contenu visible uniquement pour le crawler de Google, puis l'a découvert dans les réponses de Perplexity. C'est le type de preuve qui transforme l'abstrait « ils prennent des données quelque part » en une chaîne d'approvisionnement concrète.
La technique du « leurre empoisonné » mérite d'être retenue pour une autre raison. Elle montre que les grandes plateformes sont passées depuis longtemps des blocages à la collecte de preuves : contenu marqué, pages honeypot, extraits uniques. Votre prudence au niveau du réseau ne vous sauve pas si le contenu est lui-même marqué.
Les faiblesses de la plainte, rarement évoquées
Reddit a passé le premier filtre, mais sa position n'est pas sans faille, et la défense frappe à deux points sensibles.
Premier — qui possède réellement les publications. Les conditions d'utilisation de Reddit laissent les droits sur les publications aux auteurs, tandis que la plateforme obtient une licence non exclusive. SerpApi soutient que cette rupture est « fatale pour chaque point » de la plainte : on ne peut pas protéger par le droit d'auteur ce que l'on ne possède pas. Le même argument contre Google n'a pas du tout fonctionné — là, le litige concernait les propres résultats de Google.
Deuxième — la capacité de protection d'exemples spécifiques. Dans la plainte élargie, Reddit a fourni des échantillons de matériel qu'il considère comme son œuvre protégée : un extrait de politique de confidentialité, une liste de films, la date et l'adresse d'un club de jazz. La défense répond à juste titre que les listes, les faits et les courts extraits ne franchissent pas le seuil de protection. De plus, un argument distinct : SearchGuard n'est pas une « mesure de contrôle d'accès efficace », puisque les gens le traversent sans heurts — un chemin d'accès reste toujours ouvert.
Ces arguments n'ont pas disparu — ils ont simplement été reportés à l'étape sur le fond. Donc, « Reddit a gagné » — c'est une simplification forte. Il serait plus juste de dire : la théorie anti-contournement contre les scrapers et les acheteurs de données a obtenu le droit de vivre devant le tribunal de New York. Aux États-Unis, la décision d'un district ne lie pas un autre, et nous observons une fracture de la pratique en temps réel.
Qu'est-ce que cela signifie pratiquement
Si vous collectez des données pour les affaires, certaines choses assez concrètes découlent de la décision du 31 juillet.
- Évaluez non pas la barrière, mais le contenu derrière elle. Contourner un CAPTCHA sur une page avec des prix, des horaires ou des adresses — c'est une histoire de risque. Contourner la même barrière pour des textes, des photos et des avis, dont les droits appartiennent à quelqu'un — c'est fondamentalement différent. L'exposition juridique est déterminée par l'objet, et non par l'outil.
- L'acheteur de données n'est plus en sécurité. Perplexity a construit sa défense sur le fait qu'elle n'est qu'un acquéreur final et « résume les discussions publiques ». Le tribunal n'a pas jugé cet argument suffisant pour clore l'affaire. C'est un signal direct pour tous ceux qui achètent des ensembles de données prêts à l'emploi : il faudra être capable d'expliquer l'origine des données.
- Le contrat et les ToS vivent séparément du DMCA. Même là où la théorie du droit d'auteur s'effondre, la violation des conditions d'utilisation reste un fondement autonome. La défaite d'une plateforme selon le DMCA ne signifie pas que le scraping est « autorisé par le tribunal ».
- Le niveau d'infrastructure est devenu visible pour les plaignants. Lorsque les fournisseurs de proxy deviennent des défendeurs, la question « que sait et enregistre mon fournisseur sur mon trafic » cesse d'être paranoïaque. Choisissez un fournisseur dont les sources de pool sont claires, qui a une politique d'utilisation acceptable et un KYC — c'est exactement la partie ennuyeuse de la paperasse qui distingue un partenaire d'infrastructure d'un participant à un schéma étranger. Nous avons écrit sur les critères dans notre analyse des pratiques légales de collecte de données via des proxies.
- Séparez les tâches par niveau de risque. La surveillance des prix, la vérification des résultats, le contrôle de la disponibilité de vos propres ressources et les tests géographiques — ce sont des scénarios typiques avec un profil juridique prévisible ; pour eux, des proxies résidentiels ou des adresses de datacenter bon marché conviennent, si la plateforme ne nécessite pas d'origine « résidentielle ». L'extraction massive de contenu protégé par le droit d'auteur pour former des modèles — c'est un scénario qui se déplace maintenant dans les salles de tribunal, et il doit être résolu par une licence, et non par une rotation d'IP.
En résumé
Deux tribunaux fédéraux en onze jours ont divergé dans l'évaluation d'un même contournement d'une même barrière. Californie : contourner la protection de recherche sans droit d'auteur derrière elle — pas une violation du DMCA. New York : si derrière la barrière se trouve un contenu utilisateur protégé, l'allégation anti-contournement a le droit d'être examinée, ainsi que les allégations contre les intermédiaires et l'acheteur de données.
Pour ceux qui travaillent avec des données de manière professionnelle, la conclusion est unique : l'aspect technique de la collecte n'est plus le principal facteur de risque. La question principale est celle des droits sur ce que vous prenez et de la transparence de la chaîne par laquelle ces données vous sont parvenues. La prochaine étape dans l'affaire est la motion d'Oxylabs, que le tribunal a dégelée après la décision concernant les co-défendeurs.
```