Volver al blog

El tribunal desestima la demanda de Reddit contra Perplexity: dos decisiones sobre scraping en 11 días

El 31 de julio de 2026, el juez Engelmaier (SDNY) se negó a desestimar la demanda de Reddit contra Perplexity AI y SerpApi: las reclamaciones de elusión bajo el DMCA se mantuvieron. 11 días antes, un tribunal en California desestimó una demanda casi idéntica de Google contra el mismo demandado. ¿Por qué la misma elusión recibió evaluaciones opuestas, qué tienen que ver los proveedores de proxy Oxylabs y AWMProxy y qué se puede concluir de esto?

📅3 de agosto de 2026
El tribunal desestima la demanda de Reddit contra Perplexity: dos decisiones sobre scraping en 11 días
```html

El 31 de julio de 2026, el juez federal Paul Engelmayer (Distrito Sur de Nueva York) se negó a desestimar la demanda de Reddit contra Perplexity AI y el agregador de resultados de búsqueda SerpApi. Las principales reclamaciones bajo la ley anti-bot DMCA § 1201(a) se mantuvieron — el caso avanza. Once días antes, otro juez federal en el Norte de California desechó una demanda casi idéntica de Google contra el mismo SerpApi. La misma barrera técnica, el mismo demandado — y dos resultados opuestos.

No es una contradicción entre los tribunales. Es una señal clara de dónde realmente se traza la línea legal en el scraping de 2026. Y no está donde los ingenieros suelen buscarla.

¿Qué decidió exactamente el tribunal el 31 de julio?

El caso Reddit, Inc. v. SerpApi LLC et al. (n.º 1:25-cv-08736) fue presentado por Reddit el 22 de octubre de 2025, y en febrero de 2026 amplió la queja. Hay cuatro demandados, y la composición es importante: la empresa de IA Perplexity AI, el agregador de resultados SerpApi y dos proveedores de proxy — Oxylabs UAB y AWMProxy.

La lógica de la acusación es la siguiente: los intermediarios a gran escala extraían contenido de Reddit no desde los servidores de Reddit, sino desde los resultados de búsqueda de Google, ocultando su origen para eludir la protección; Perplexity compraba estos datos y los introducía en su motor de IA.

El juez Engelmayer dividió las reclamaciones:

  • Mantuvieron: la reclamación principal bajo DMCA § 1201(a) — el eludir la medida técnica de control de acceso. El tribunal reconoció que el mecanismo de protección Google SearchGuard califica como una medida de control de acceso en el sentido de la ley, y que Reddit está "dentro de la zona de interés" de las normas anti-bot del DMCA. Según la formulación del juez, la plataforma "encarna el mismo mercado digital global de obras protegidas" para cuyo desarrollo se aprobó el DMCA.
  • Desestimado: la reclamación sobre "traffic shaping" bajo § 1201(b) contra SerpApi, así como las demandas por competencia desleal y enriquecimiento injusto contra ambos demandados.

Una importante salvedad: esta decisión es sobre la moción para desestimar la demanda, no un veredicto sobre el fondo. El tribunal solo dijo que el caso tiene derecho a continuar hasta el juicio. Pero es en esta etapa donde normalmente mueren las demandas débiles contra los scrapers — esta no murió.

¿Por qué Google perdió y Reddit pasó el filtro?

El 20 de julio de 2026, la jueza presidenta Yvonne Gonzalez Rogers en el Distrito Norte de California desestimó la demanda de Google contra SerpApi bajo el DMCA — sin derecho a re-presentarla en su forma anterior. Nosotros analizamos detalladamente esta decisión: el tribunal estuvo de acuerdo en que la suplantación de huellas de navegador, la rotación de IP y la resolución de captchas son técnicamente eludir, pero el eludir en sí no es ilegal si detrás de la barrera no hay obras protegidas por derechos de autor.

Google tropezó en este punto. La empresa no alegó que los resultados de su búsqueda están protegidos por la Ley de Derechos de Autor, y no demostró que implementó SearchGuard "con el permiso del titular de derechos", como exige 17 U.S.C. § 1201(a)(3)(B). La barrera protegía los ingresos publicitarios — y el DMCA protege no los ingresos, sino el copyright.

Reddit entró desde otro ángulo. Detrás del mismo SearchGuard, según Reddit, no hay "resultados irrelevantes planos", sino publicaciones de usuarios — textos de personas reales, cuyos derechos Reddit licencia, incluyendo acuerdos monetarios con Google y OpenAI. La diferencia no está en la técnica de eludir. La diferencia está en qué exactamente hay detrás de la barrera.

La conclusión que los ingenieros y propietarios de datos deben tener en cuenta: la identidad técnica de las acciones no implica la identidad legal de las consecuencias. El mismo script con rotación de IP residenciales en un caso — es trabajo legal con hechos públicos, en otro — eludir la protección de una obra protegida.

¿Dónde están los proxies en este caso?

Para nuestra industria, lo más interesante en el caso no es Perplexity, sino los otros dos nombres en la lista de demandados. Oxylabs y AWMProxy no están involucrados como testigos ni como "herramientas de terceros", sino como co-demandados: el demandante considera que la infraestructura de anonimización era parte del esquema de eludir.

El tribunal suspendió la moción de Oxylabs para desestimar la demanda — debido a la significativa superposición de sus argumentos con los de SerpApi y Perplexity, el briefing se congeló hasta que se resolvieran las mociones de los co-demandados. Estas mociones ahora han sido resueltas, y la teoría básica anti-bot ha sobrevivido. Es decir, la cola ha llegado al proveedor de proxy, y se presenta en una posición de negociación notablemente peor que hace seis meses.

Dos detalles más de los documentos del caso que dicen mucho sobre la escala y los métodos de prueba:

  • Según los datos obtenidos por solicitud judicial, SerpApi accedió a aproximadamente 1.8 mil millones de páginas de resultados de búsqueda de Google que contenían datos de Reddit durante dos semanas de julio de 2025.
  • Reddit aplicó una trampa clásica: publicó contenido visible solo para el crawler de Google, y luego lo descubrió en las respuestas de Perplexity. Este es el tipo de prueba que convierte el abstracto "ellos obtienen datos de algún lugar" en una cadena de suministro concreta.

El truco de la "cebo envenenado" vale la pena recordar por otra razón. Muestra que las grandes plataformas han pasado de bloqueos a la recolección de pruebas: contenido marcado, páginas honeypot, fragmentos únicos. Su cuidado a nivel de red no ayuda si el contenido está marcado por sí mismo.

Puntos débiles de la demanda que rara vez se mencionan

Reddit pasó el primer filtro, pero su posición no es en absoluto impecable, y la defensa ataca en dos puntos vulnerables.

Primero — ¿quién posee realmente las publicaciones? El acuerdo de usuario de Reddit deja los derechos sobre las publicaciones a los autores, mientras que la plataforma recibe una licencia no exclusiva. SerpApi sostiene que esta ruptura es "fatal para cada punto" de la queja: no se puede proteger por derechos de autor algo que no se posee. El mismo argumento contra Google no funcionó en absoluto — allí la disputa era sobre su propia entrega.

Segundo — la capacidad de protección de ejemplos específicos. En la queja ampliada, Reddit presentó muestras de material que considera de su autoría: un fragmento de la política de privacidad, una lista de películas, la fecha y la dirección de un club de jazz. La defensa responde razonablemente que listas, hechos y fragmentos cortos no alcanzan el umbral de protección. Además, un argumento separado: SearchGuard no es una "medida efectiva de control de acceso", ya que una persona puede pasarla sin problemas — una ruta de acceso siempre permanece abierta.

Estos argumentos no han desaparecido — simplemente se han pospuesto hasta la etapa de fondo. Así que "Reddit ganó" es una simplificación fuerte. Es más correcto: la teoría anti-bot contra scrapers y compradores de datos ha obtenido derecho a vivir en el tribunal de Nueva York. En los EE. UU., la decisión de un distrito no vincula a otro, y estamos observando una división de prácticas en tiempo real.

¿Qué significa esto prácticamente?

Si usted recopila datos para un negocio, de la decisión del 31 de julio se derivan cosas bastante concretas.

  1. Evalúe no la barrera, sino el contenido detrás de ella. Eludir un captcha en una página con precios, horarios o direcciones — es una historia de riesgo. Eludir la misma barrera por textos, fotos y reseñas, cuyos derechos pertenecen a alguien, — es fundamentalmente diferente. La exposición legal está determinada por el objeto, no por la herramienta.
  2. El comprador de datos ha dejado de estar a salvo. Perplexity construyó su defensa sobre el hecho de que solo es un comprador final y "resume discusiones públicas". El tribunal no consideró este argumento suficiente para cerrar el caso. Esta es una señal directa para todos los que compran conjuntos de datos listos: el origen de los datos deberá ser explicable.
  3. El contrato y los Términos de Servicio viven separados del DMCA. Incluso donde la teoría del copyright se desmorona, sigue existiendo la violación de los términos de uso como base independiente. La pérdida de la plataforma bajo el DMCA no significa que el scraping esté "permitido por el tribunal".
  4. La capa de infraestructura se ha vuelto visible para los demandantes. Cuando los proveedores de proxy se convierten en demandados, la pregunta "¿qué sabe y registra mi proveedor sobre mi tráfico?" deja de ser paranoica. Elija un proveedor cuyos orígenes del pool sean claros, que tenga una política de uso aceptable y KYC — esta es precisamente la parte aburrida del papeleo que distingue a un socio de infraestructura de un participante en un esquema ajeno. Sobre los criterios hemos escrito en el análisis de prácticas legales de recolección de datos a través de proxies.
  5. Separe las tareas por nivel de riesgo. Monitoreo de precios, verificación de resultados, control de disponibilidad de recursos propios y pruebas geográficas — son escenarios típicos con un perfil legal predecible; para ellos son adecuados proxies residenciales o direcciones de centros de datos baratos, si la plataforma no requiere un origen "residencial". La extracción masiva de contenido protegido por derechos de autor para entrenar modelos — es un escenario que ahora se traslada a las salas de los tribunales, y debe resolverse con una licencia, no con rotación de IP.

En resumen

Dos tribunales federales en once días discrepaban en la evaluación de la misma elusión de la misma barrera. California: eludir la protección de búsqueda sin derechos de autor detrás de ella — no es una violación del DMCA. Nueva York: si detrás de la barrera hay contenido de usuario protegido, la reclamación anti-bot tiene derecho a ser considerada, junto con las reclamaciones contra intermediarios y compradores de datos.

Para aquellos que trabajan con datos de manera profesional, la conclusión es una: el lado técnico de la recolección ha dejado de ser el principal factor de riesgo. La principal cuestión ahora es sobre los derechos de lo que se está tomando y la transparencia de la cadena a través de la cual esos datos llegaron a usted. El siguiente hito en el caso es la moción de Oxylabs, que el tribunal ha descongelado tras la decisión sobre los co-demandados.

```