返回博客

法院驳回Reddit对Perplexity的诉讼:11天内的两项抓取决定

2026年7月31日,法官恩格尔迈尔(SDNY)拒绝关闭Reddit对Perplexity AI和SerpApi的诉讼:根据DMCA的反规避指控成立。在此之前的11天,加利福尼亚的法院驳回了谷歌对同一被告的几乎相同的诉讼。为什么同样的规避行为得到了相反的评估,Oxylabs和AWMProxy的代理服务提供商与此有什么关系,以及这意味着什么。

📅2026年8月3日
法院驳回Reddit对Perplexity的诉讼:11天内的两项抓取决定

2026年7月31日,联邦法官保罗·恩格尔迈尔(纽约南区)拒绝关闭Reddit对Perplexity AI和搜索结果聚合器SerpApi的诉讼。关于反规避条款DMCA § 1201(a)的关键指控得以维持——案件将继续进行。在此之前的11天,另一位联邦法官在加利福尼亚北区驳回了Google对同一SerpApi的几乎相同的诉讼。相同的技术障碍,相同的被告——却有两个截然不同的结果。

这并不是法院之间的矛盾。这是一个明确的信号,表明2026年抓取的法律界限实际上在哪里。它并不在工程师们习惯寻找的地方。

法院在7月31日到底做出了什么决定

案件Reddit, Inc. v. SerpApi LLC et al.(案号1:25-cv-08736)由Reddit于2025年10月22日提起,2026年2月扩大了投诉。被告有四个,组成很重要:AI公司Perplexity AI、聚合器SerpApi和两个代理提供商——Oxylabs UABAWMProxy

指控的逻辑是:中介在工业规模上并不是从Reddit的服务器提取内容,而是从Google的搜索结果中提取,掩盖其来源以绕过保护;Perplexity购买了这些数据并将其输入到自己的AI引擎中。

恩格尔迈尔法官对指控进行了分类:

  • 维持:关于DMCA § 1201(a)的主要指控——绕过技术访问控制措施。法院认为,Google SearchGuard的保护机制符合法律意义上的访问控制措施,而Reddit本身处于DMCA反规避规范的“利益范围”内。法官的表述是,该平台“体现了保护作品的全球数字市场”,而DMCA正是为了促进这一市场的发展而制定的。
  • 驳回:对SerpApi的关于“流量劫持”的指控,以及对两个被告的不正当竞争和不当得利的诉讼。

重要的说明:这是对驳回诉讼动议的裁决,而不是对案件实质的裁决。法院只是表示,案件有权继续进行审理。但通常在这个阶段,针对抓取者的弱诉讼往往会被驳回——而这个诉讼并没有被驳回。

为什么Google输了,而Reddit通过了审查

2026年7月20日,加利福尼亚北区的首席法官伊冯娜·冈萨雷斯·罗杰斯驳回了Google对SerpApi的DMCA诉讼——不允许以原形式重新提交。我们详细分析了这个决定:法院同意,浏览器指纹的替换、IP的轮换和验证码的解决在技术上构成了绕过,但如果保护后面没有受版权保护的作品,绕过本身并不违法。

Google正是在这一点上失误。该公司并没有声明其搜索结果受版权法保护,也没有显示其实施SearchGuard是“经权利人许可”的,正如17 U.S.C. § 1201(a)(3)(B)所要求的。障碍保护的是广告收入——而DMCA保护的不是收入,而是版权。

Reddit则从另一个角度切入。根据Reddit的说法,SearchGuard后面并不是“平坦的无关结果”,而是用户帖子——那些由活人撰写的文本,Reddit对其拥有版权,包括与Google和OpenAI的金钱交易。差异不在于绕过的技术,而在于障碍后面到底是什么

值得工程师和数据拥有者注意的结论是:行为的技术身份并不意味着后果的法律身份相同。在一个案件中,使用轮换的居民IP的同一脚本——是合法处理公共事实,而在另一个案件中——则是绕过受保护作品的保护。

在这个案件中代理的角色

对我们行业来说,这个案件中最有趣的并不是Perplexity,而是名单上的另外两个名字。Oxylabs和AWMProxy并不是作为证人或“第三方工具”被引入,而是作为共同被告:原告认为,匿名化基础设施是绕过方案的一部分。

Oxylabs的驳回诉讼动议被法院暂停——由于其论点与SerpApi和Perplexity的论点有实质性重叠,简报被冻结,直到共同被告的动议得到解决。这些动议现在已被解决,而基本的反规避理论依然存活。也就是说,轮到代理提供商了,而他们的谈判地位显然比六个月前差得多。

案件材料中还有两个细节,说明了规模和证明方法:

  • 根据通过法院请求获得的数据,SerpApi在2025年7月的两周内访问了大约18亿个包含Reddit数据的Google搜索结果页面
  • Reddit使用了经典的诱饵策略:发布仅对Google爬虫可见的内容,然后在Perplexity的响应中发现它。这正是将抽象的“他们在某处获取数据”转变为具体的供应链的证据类型。

这种“诱饵”策略值得记住,还有另一个原因。它表明,大型平台早已从封锁转向收集证据:标记内容、蜜罐页面、独特的摘要。当内容本身被标记时,你的网络层面的谨慎并不能拯救你。

诉讼的薄弱环节,鲜有报道

Reddit通过了第一道筛选,但其立场远非无懈可击,辩护在两个痛点上施加压力。

第一——谁拥有帖子。 Reddit的用户协议将发布权保留给作者,而平台获得的是非独占许可。SerpApi坚称,这一断裂“对每一项”投诉都是致命的:不能保护自己不拥有的版权。对Google的同样论点根本不起作用——因为那里的争议是关于自己的结果。

第二——具体示例的可保护性。 在扩展的投诉中,Reddit提供了其认为是自己作品的材料样本:隐私政策的片段、电影列表、爵士乐俱乐部的日期和地址。辩护合理地回应,列表、事实和短片段不达保护门槛。此外,还有一个单独的论点:SearchGuard并不是“有效的访问控制措施”,因为人们可以无缝通过——一个访问路径始终是开放的。

这些论点并没有消失——它们只是被推迟到实质阶段。因此,“Reddit赢了”是一个强烈的简化。更准确地说:反规避理论对抓取者和数据购买者在纽约法院获得了生存的权利。在美国,一个地区的裁决并不约束另一个地区,我们正在实时观察实践的分裂。

这在实际中意味着什么

如果你为业务收集数据,7月31日的裁决带来了相当切实的事情。

  1. 评估障碍,而不是其背后的内容。 绕过价格、时间表或地址页面上的验证码——这是一个风险故事。为了获取文本、照片和评论而绕过同一障碍,权利属于某人——这是根本不同的。法律风险由对象而非工具决定。
  2. 数据购买者不再安全。 Perplexity的保护建立在它只是最终买家和“总结公共讨论”的基础上。法院并未认为这一论点足以关闭案件。这是对所有购买现成数据集的人的直接信号:数据的来源必须能够解释。
  3. 合同和服务条款与DMCA是分开的。 即使在版权理论崩溃的地方,违反使用条款仍然作为独立的依据存在。平台在DMCA上的失败并不意味着抓取“被法院允许”。
  4. 基础设施层对原告变得可见。 当代理提供商成为被告时,“我的供应商知道并记录了我的流量什么”这个问题不再是偏执的。选择一个能够清楚说明池来源、拥有明确的可接受使用政策和KYC的提供商——这正是区分基础设施合作伙伴与参与他人计划的无聊文书部分。我们在合法数据收集实践的分析中写过这些标准。
  5. 按风险级别划分任务。 价格监控、结果检查、自己资源的可用性控制和地理测试——这些是典型场景,具有可预测的法律特征;对于这些场景,居民代理或便宜的数据中心地址是合适的,如果平台不要求“住宅”来源。大规模提取他人版权内容以训练模型——这一场景现在正转移到法庭上,需要通过许可而不是IP轮换来解决。

简而言之

在短短11天内,两家联邦法院对同一障碍的同一绕过做出了不同的评估。加利福尼亚:在其背后没有版权的搜索保护的绕过——不违反DMCA。纽约:如果障碍后面是受保护的用户内容,反规避指控有权获得审理,同时也包括对中介和数据购买者的指控。

对于那些专业处理数据的人来说,结论只有一个:数据收集的技术方面不再是主要风险因素。主要问题是你所获取内容的权利,以及这些数据到达你手中的透明度。案件的下一步是Oxylabs的动议,法院在对共同被告的裁决后解冻了该动议。