Voltar ao blog

Tribunal rejeita ação do Reddit contra a Perplexity: duas decisões sobre scraping em 11 dias

31 de julho de 2026, o juiz Engelmaier (SDNY) se recusou a encerrar a ação do Reddit contra a Perplexity AI e a SerpApi: as alegações de contorno anti-DMCA foram mantidas. Onze dias antes, um tribunal na Califórnia rejeitou uma ação quase idêntica do Google contra o mesmo réu. Por que o mesmo contorno recebeu avaliações opostas, qual é a relação com os provedores de proxy Oxylabs e AWMProxy e o que isso implica.

📅3 de agosto de 2026
Tribunal rejeita ação do Reddit contra a Perplexity: duas decisões sobre scraping em 11 dias
```html

Em 31 de julho de 2026, o juiz federal Paul Engelmayer (Distrito Sul de Nova York) recusou-se a encerrar a ação do Reddit contra a Perplexity AI e o agregador de resultados de busca SerpApi. As principais alegações sob a cláusula anti-bypass do DMCA § 1201(a) se mantiveram — o caso prossegue. Onze dias antes, outro juiz federal, na Califórnia do Norte, descartou uma ação quase idêntica do Google contra o mesmo SerpApi. O mesmo obstáculo técnico, o mesmo réu — e dois resultados opostos.

Isso não é uma contradição entre os tribunais. É um sinal claro de onde realmente passa a linha legal em relação ao scraping em 2026. E essa linha não está onde os engenheiros costumam procurá-la.

O que exatamente o tribunal decidiu em 31 de julho

O caso Reddit, Inc. v. SerpApi LLC et al. (nº 1:25-cv-08736) foi apresentado pelo Reddit em 22 de outubro de 2025, e em fevereiro de 2026, a reclamação foi ampliada. Há quatro réus, e a composição é importante: a empresa de IA Perplexity AI, o agregador de resultados SerpApi e dois provedores de proxy — Oxylabs UAB e AWMProxy.

A lógica da acusação é a seguinte: intermediários em larga escala extraíam conteúdo do Reddit não dos servidores do próprio Reddit, mas dos resultados de busca do Google, mascarando sua origem para contornar a proteção; a Perplexity comprava esses dados e os inseria em seu motor de IA.

O juiz Engelmayer separou as alegações:

  • Se manteve: a alegação principal sob o DMCA § 1201(a) — contornar a medida técnica de controle de acesso. O tribunal reconheceu que o mecanismo de proteção Google SearchGuard é qualificado como uma medida de controle de acesso sob a lei, e o próprio Reddit está "na zona de interesses" das normas anti-bypass do DMCA. Na formulação do juiz, a plataforma "incorpora o próprio mercado digital global de obras protegidas", para o qual o DMCA foi criado.
  • Rejeitado: a alegação de "traffic" sob § 1201(b) contra a SerpApi, assim como as ações por concorrência desleal e enriquecimento sem causa contra ambos os réus.

Uma importante ressalva: esta decisão é sobre o pedido de rejeição da ação, e não um veredicto sobre o mérito. O tribunal apenas disse que o caso tem o direito de prosseguir para o julgamento. Mas é nesta fase que normalmente morrem as ações fracas contra scrapers — esta não morreu.

Por que o Google perdeu, enquanto o Reddit passou pelo filtro

Em 20 de julho de 2026, a juíza presidente Yvonne Gonzalez Rogers, no Distrito Norte da Califórnia, rejeitou a ação do Google contra a SerpApi sob o DMCA — sem direito a reapresentação na forma anterior. Nós analisamos essa decisão em detalhes: o tribunal concordou que a substituição de impressões digitais do navegador, a rotação de IP e a resolução de CAPTCHA são tecnicamente contornos, mas o contorno em si não é ilegal, se não houver obras protegidas por direitos autorais por trás do obstáculo.

O Google tropeçou nisso. A empresa não alegou que os resultados de sua busca são protegidos pela Lei de Direitos Autorais e não demonstrou que implementou o SearchGuard "com a permissão do titular dos direitos", como exige 17 U.S.C. § 1201(a)(3)(B). O obstáculo protegia a receita publicitária — e o DMCA protege não a receita, mas o copyright.

O Reddit entrou por outro lado. Por trás do mesmo SearchGuard, segundo o Reddit, não estão "resultados planos e irrelevantes", mas postagens de usuários — textos de pessoas reais, cujos direitos o Reddit licencia, inclusive por meio de transações monetárias com o Google e a OpenAI. A diferença não está na técnica de contorno. A diferença está no que exatamente está por trás do obstáculo.

A conclusão que deve ser registrada por engenheiros e proprietários de dados: a identidade técnica das ações não significa identidade legal das consequências. O mesmo script com rotação de IPs residenciais em um caso — é trabalho legal com fatos públicos, em outro — é contornar a proteção de uma obra protegida.

Onde entram os proxies neste caso

Para nossa indústria, o mais interessante no caso não é a Perplexity, mas os outros dois nomes na lista de réus. A Oxylabs e a AWMProxy não foram convocadas como testemunhas e não como "instrumento de terceiros", mas como co-réus: o autor acredita que a infraestrutura de anonimização fazia parte do esquema de contorno.

O pedido da Oxylabs para rejeitar a ação foi suspenso pelo tribunal — devido à substancial sobreposição de seus argumentos com os argumentos da SerpApi e da Perplexity, a audiência foi congelada até a resolução dos pedidos dos co-réus. Esses pedidos agora foram resolvidos, e a teoria básica anti-bypass sobreviveu. Ou seja, a vez chegou ao provedor de proxies, e ele se apresenta a ela em uma posição de negociação visivelmente pior do que há seis meses.

Mais dois detalhes dos documentos do caso, que dizem muito sobre a escala e os métodos de prova:

  • De acordo com dados obtidos por solicitação judicial, a SerpApi acessou aproximadamente 1,8 bilhões de páginas de resultados de busca do Google que continham dados do Reddit durante duas semanas de julho de 2025.
  • O Reddit aplicou uma armadilha clássica: publicou conteúdo visível apenas para o crawler do Google e, em seguida, o descobriu nas respostas da Perplexity. Este é o tipo de prova que transforma o abstrato "eles pegam dados de algum lugar" em uma cadeia de fornecimento concreta.

A tática da "isca envenenada" deve ser lembrada também por outro motivo. Ela mostra que grandes plataformas há muito deixaram de lado os bloqueios e passaram a coletar provas: conteúdo marcado, páginas honeypot, trechos únicos. Sua cautela em nível de rede não salva, se o conteúdo em si estiver marcado.

Pontos fracos da ação que raramente são mencionados

O Reddit passou pelo primeiro filtro, mas sua posição está longe de ser impecável, e a defesa ataca em dois pontos vulneráveis.

Primeiro — quem realmente possui as postagens. O contrato de usuário do Reddit mantém os direitos sobre as publicações com os autores, enquanto a plataforma recebe uma licença não exclusiva. A SerpApi argumenta que essa lacuna é "fatal para cada ponto" da reclamação: não se pode proteger por copyright algo que não se possui. O mesmo argumento contra o Google não funcionou de forma alguma — lá a disputa era sobre seus próprios resultados.

Segundo — a capacidade de proteção de exemplos específicos. Na reclamação ampliada, o Reddit apresentou amostras de material que considera de sua autoria: um trecho da política de privacidade, uma lista de filmes, a data e o endereço de um clube de jazz. A defesa responde de forma razoável que listas, fatos e trechos curtos não atingem o limiar de proteção. Além disso, um argumento separado: o SearchGuard não é uma "medida eficaz de controle de acesso", uma vez que uma pessoa pode passar por ele sem costura — uma rota de acesso permanece sempre aberta.

Esses argumentos não desapareceram — eles foram apenas adiados até a fase de mérito. Portanto, "o Reddit venceu" é uma simplificação forte. O mais correto seria: a teoria anti-bypass contra scrapers e compradores de dados ganhou o direito de existir no tribunal de Nova York. Nos EUA, a decisão de um distrito não vincula o outro, e estamos observando uma divisão na prática em tempo real.

O que isso significa na prática

Se você coleta dados para negócios, da decisão de 31 de julho decorrem coisas bastante práticas.

  1. Avalie não o obstáculo, mas o conteúdo por trás dele. Contornar um CAPTCHA em uma página com preços, horários ou endereços — é uma história de risco. Contornar o mesmo obstáculo em busca de textos, fotos e avaliações, cujos direitos pertencem a alguém — é uma questão fundamentalmente diferente. A exposição legal é determinada pelo objeto, não pela ferramenta.
  2. O comprador de dados deixou de estar seguro. A Perplexity construiu sua defesa com o argumento de que era apenas uma adquirente final e "resumia discussões públicas". O tribunal não considerou esse argumento suficiente para encerrar o caso. Este é um sinal direto para todos que compram conjuntos de dados prontos: a origem dos dados precisará ser explicada.
  3. Contrato e ToS vivem separados do DMCA. Mesmo onde a teoria de copyright desmorona, permanece a violação dos termos de uso como uma base independente. A derrota da plataforma sob o DMCA não significa que o scraping é "autorizado pelo tribunal".
  4. A camada de infraestrutura tornou-se visível para os autores. Quando provedores de proxies entram na lista de réus, a questão "o que meu fornecedor sabe e registra sobre meu tráfego" deixa de ser paranoica. Escolha um provedor cujas fontes do pool sejam claras, que tenha uma política de uso aceitável e KYC — essa é exatamente a parte chata da papelada que distingue um parceiro de infraestrutura de um participante de um esquema alheio. Sobre os critérios, escrevemos na análise práticas legais de coleta de dados através de proxies.
  5. Separe tarefas por nível de risco. Monitoramento de preços, verificação de resultados, controle de disponibilidade de recursos próprios e testes geográficos — cenários típicos com perfis legais previsíveis; para eles, são adequados proxies residenciais ou endereços de data center baratos, se a plataforma não exigir origem "residencial". A extração em massa de conteúdo autoral alheio para treinar modelos — é um cenário que agora está indo para os tribunais, e deve ser resolvido com licença, e não com rotação de IP.

Resumindo

Dois tribunais federais, em onze dias, discordaram na avaliação do mesmo contorno de um mesmo obstáculo. Califórnia: contornar a proteção de busca sem copyright por trás dela — não é uma violação do DMCA. Nova York: se por trás do obstáculo está conteúdo de usuário protegido, a alegação anti-bypass tem o direito de ser considerada, juntamente com as alegações contra intermediários e compradores de dados.

Para aqueles que trabalham com dados profissionalmente, a conclusão é uma só: o lado técnico da coleta deixou de ser o principal fator de risco. O principal agora é a questão dos direitos sobre o que você está coletando e a transparência da cadeia pela qual esses dados chegaram até você. O próximo marco no caso é o pedido da Oxylabs, que o tribunal descongelou após a decisão sobre os co-réus.

```