Quay lại blog

Tòa án bác đơn kiện của Reddit đối với Perplexity: Hai quyết định về việc thu thập dữ liệu chỉ trong 11 ngày

Vào ngày 31 tháng 7 năm 2026, thẩm phán Engelmaier (SDNY) đã từ chối bác bỏ đơn kiện của Reddit đối với Perplexity AI và SerpApi: các cáo buộc chống lại việc vượt qua DMCA đã được duy trì. Chỉ 11 ngày trước đó, tòa án ở California đã bác bỏ một đơn kiện gần giống của Google đối với cùng một bị đơn. Tại sao cùng một hành vi vượt qua lại nhận được những đánh giá trái ngược, mối liên hệ giữa các nhà cung cấp proxy Oxylabs và AWMProxy là gì và điều này có ý nghĩa gì.

📅3 tháng 8, 2026
Tòa án bác đơn kiện của Reddit đối với Perplexity: Hai quyết định về việc thu thập dữ liệu chỉ trong 11 ngày
```html

Ngày 31 tháng 7 năm 2026, thẩm phán liên bang Paul Engelmaier (Quận miền Nam New York) đã từ chối bác bỏ vụ kiện của Reddit chống lại Perplexity AI và nhà cung cấp tổng hợp kết quả tìm kiếm SerpApi. Các cáo buộc chính theo điều khoản chống vượt qua DMCA § 1201(a) đã được duy trì — vụ án tiếp tục tiến triển. Mười một ngày trước đó, một thẩm phán liên bang khác ở Bắc California đã bác bỏ một vụ kiện gần như tương tự của Google chống lại cùng một SerpApi. Cùng một rào cản kỹ thuật, cùng một bị đơn — và hai kết quả trái ngược.

Đây không phải là sự mâu thuẫn giữa các tòa án. Đây là tín hiệu rõ ràng về nơi mà ranh giới pháp lý thực sự nằm trong việc thu thập dữ liệu năm 2026. Và nó không nằm ở nơi mà các kỹ sư thường tìm kiếm.

Điều gì đã được tòa án quyết định vào ngày 31 tháng 7

Vụ án Reddit, Inc. v. SerpApi LLC et al. (số 1:25-cv-08736) được Reddit nộp vào ngày 22 tháng 10 năm 2025, và vào tháng 2 năm 2026 đã mở rộng đơn kiện. Có bốn bị đơn, và thành phần là rất quan trọng: công ty AI Perplexity AI, nhà cung cấp tổng hợp SerpApi và hai nhà cung cấp proxy — Oxylabs UABAWMProxy.

Logic của cáo buộc là: các trung gian đã thu thập nội dung của Reddit trên quy mô công nghiệp không từ máy chủ của chính Reddit, mà từ kết quả tìm kiếm của Google, che giấu nguồn gốc của nó để vượt qua bảo vệ; Perplexity đã mua những dữ liệu này và đưa chúng vào động cơ AI của mình.

Thẩm phán Engelmaier đã phân chia các cáo buộc:

  • Được duy trì: cáo buộc chính theo DMCA § 1201(a) — vượt qua biện pháp kiểm soát truy cập kỹ thuật. Tòa án đã công nhận rằng cơ chế bảo vệ Google SearchGuard được phân loại là biện pháp kiểm soát truy cập theo nghĩa của luật, và Reddit nằm "trong khu vực lợi ích" của các quy định chống vượt qua DMCA. Theo cách diễn đạt của thẩm phán, nền tảng này "thể hiện thị trường kỹ thuật số toàn cầu của các tác phẩm được bảo vệ", vì sự phát triển của nó mà DMCA đã được thông qua.
  • Bị bác bỏ: cáo buộc về "traffic" theo § 1201(b) chống lại SerpApi, cũng như các vụ kiện về cạnh tranh không lành mạnh và làm giàu không chính đáng chống lại cả hai bị đơn.

Một lưu ý quan trọng: đây là quyết định về đơn yêu cầu bác bỏ vụ kiện, chứ không phải phán quyết về nội dung. Tòa chỉ nói rằng vụ án có quyền tiếp tục cho đến khi xét xử. Nhưng chính ở giai đoạn này thường những vụ kiện yếu chống lại các nhà thu thập dữ liệu sẽ chết — vụ này không chết.

Tại sao Google thua, còn Reddit vượt qua được bộ lọc

Ngày 20 tháng 7 năm 2026, thẩm phán chủ tọa Yvonne Gonzalez Rogers ở Quận Bắc California đã bác bỏ vụ kiện của Google chống lại SerpApi theo DMCA — không có quyền kháng cáo lại theo hình thức cũ. Chúng tôi đã phân tích chi tiết quyết định này: tòa án đồng ý rằng việc thay thế dấu vân tay trình duyệt, xoay vòng IP và giải quyết captcha — về mặt kỹ thuật là vượt qua, nhưng việc vượt qua bản thân nó không phải là bất hợp pháp nếu không có các tác phẩm được bảo vệ bản quyền đứng sau rào cản.

Google đã vấp phải điều này. Công ty không tuyên bố rằng kết quả tìm kiếm của mình được bảo vệ bởi Luật Bản quyền, và không chứng minh rằng họ đã triển khai SearchGuard "với sự cho phép của chủ sở hữu quyền", như yêu cầu tại 17 U.S.C. § 1201(a)(3)(B). Rào cản bảo vệ doanh thu quảng cáo — và DMCA không bảo vệ doanh thu, mà bảo vệ bản quyền.

Reddit đã vào từ một phía khác. Theo Reddit, chính SearchGuard đó không phải là "các kết quả không liên quan", mà là các bài đăng của người dùng — văn bản của những người sống, mà Reddit cấp phép, bao gồm cả các giao dịch tiền tệ với Google và OpenAI. Sự khác biệt không nằm ở kỹ thuật vượt qua. Sự khác biệt nằm ở điều gì nằm sau rào cản.

Kết luận mà các kỹ sư và chủ sở hữu dữ liệu cần ghi nhớ: định danh kỹ thuật của hành động không có nghĩa là định danh pháp lý của hậu quả. Cùng một kịch bản với việc xoay vòng IP cư trú trong một vụ án — làm việc hợp pháp với các sự kiện công khai, trong một vụ khác — vượt qua sự bảo vệ của tác phẩm được bảo vệ.

Vai trò của proxy trong vụ án này

Đối với ngành của chúng tôi, điều thú vị nhất trong vụ án không phải là Perplexity, mà là hai cái tên khác trong danh sách bị đơn. Oxylabs và AWMProxy không được tham gia như nhân chứng và không phải là "công cụ của bên thứ ba", mà là đồng bị đơn: nguyên đơn cho rằng cơ sở hạ tầng ẩn danh là một phần của kế hoạch vượt qua.

Đơn yêu cầu của Oxylabs về việc bác bỏ vụ kiện đã bị tòa án hoãn lại — do sự chồng chéo đáng kể giữa các lập luận của họ với các lập luận của SerpApi và Perplexity, phiên điều trần đã bị đóng băng cho đến khi các đơn yêu cầu của các bị đơn được giải quyết. Những đơn yêu cầu này hiện đã được giải quyết, và lý thuyết chống vượt qua cơ bản đã sống sót. Điều đó có nghĩa là lượt đến lượt nhà cung cấp proxy, và họ đến với nó trong một vị thế thương lượng kém hơn rõ rệt so với nửa năm trước.

Hai chi tiết nữa từ tài liệu vụ án, điều này nói lên rất nhiều về quy mô và các phương pháp chứng minh:

  • Theo dữ liệu nhận được qua yêu cầu tòa án, SerpApi đã truy cập khoảng 1,8 tỷ trang kết quả tìm kiếm của Google chứa dữ liệu Reddit trong hai tuần của tháng 7 năm 2025.
  • Reddit đã áp dụng một cái bẫy cổ điển: đã đăng nội dung chỉ có thể nhìn thấy bởi crawler của Google, và sau đó phát hiện nó trong các phản hồi của Perplexity. Đây là loại bằng chứng biến "họ lấy dữ liệu từ đâu đó" thành một chuỗi cung ứng cụ thể.

Cách tiếp cận với "mồi độc" cần được ghi nhớ vì một lý do khác. Nó cho thấy rằng các nền tảng lớn đã lâu chuyển từ việc chặn lại sang việc thu thập bằng chứng: nội dung được đánh dấu, các trang honeypot, các đoạn trích độc đáo. Sự cẩn thận của bạn ở cấp độ mạng không cứu được nếu nội dung tự nó đã được đánh dấu.

Các điểm yếu của vụ kiện, mà ít ai viết về

Reddit đã vượt qua bộ lọc đầu tiên, nhưng vị trí của họ không hoàn hảo, và sự bảo vệ tấn công vào hai điểm yếu.

Điểm đầu tiên — ai thực sự sở hữu các bài đăng. Thỏa thuận người dùng của Reddit giữ quyền đối với các bài đăng cho các tác giả, trong khi nền tảng chỉ nhận được giấy phép không độc quyền. SerpApi khẳng định rằng sự thiếu hụt này "chết người cho từng điểm" của đơn kiện: không thể bảo vệ theo bản quyền điều mà bạn không sở hữu. Lập luận tương tự chống lại Google hoàn toàn không hiệu quả — ở đó tranh chấp diễn ra về kết quả của chính họ.

Điểm thứ hai — khả năng bảo vệ của các ví dụ cụ thể. Trong đơn kiện mở rộng, Reddit đã đưa ra các mẫu tài liệu mà họ cho là tác phẩm của mình: đoạn chính sách bảo mật, danh sách phim, ngày và địa chỉ của một câu lạc bộ jazz. Sự bảo vệ hợp lý đáp lại rằng danh sách, sự kiện và các đoạn ngắn không đạt đến ngưỡng bảo vệ. Thêm vào đó, một lập luận riêng: SearchGuard không phải là "biện pháp kiểm soát truy cập hiệu quả", vì người dùng có thể vượt qua nó một cách liền mạch — một lối vào luôn mở.

Các lập luận này không biến mất — chúng chỉ được hoãn lại cho đến giai đoạn nội dung. Vì vậy, "Reddit đã thắng" — là một sự đơn giản hóa mạnh mẽ. Chính xác hơn: lý thuyết chống vượt qua chống lại các nhà thu thập dữ liệu và người mua dữ liệu đã có quyền sống trong tòa án New York. Tại Mỹ, quyết định của một quận không ràng buộc quận khác, và chúng ta đang chứng kiến sự phân chia thực tiễn trong thời gian thực.

Điều này có nghĩa là gì trong thực tế

Nếu bạn đang thu thập dữ liệu cho doanh nghiệp, từ quyết định ngày 31 tháng 7 có thể rút ra những điều rất thực tế.

  1. Đánh giá không phải là rào cản, mà là nội dung phía sau nó. Vượt qua captcha trên trang có giá cả, lịch trình hoặc địa chỉ — đó là một câu chuyện rủi ro. Vượt qua cùng một rào cản để lấy văn bản, hình ảnh và đánh giá, quyền sở hữu của chúng thuộc về ai đó — là một câu chuyện hoàn toàn khác. Sự phơi bày pháp lý được xác định bởi đối tượng, không phải công cụ.
  2. Người mua dữ liệu không còn an toàn. Perplexity đã xây dựng sự bảo vệ dựa trên việc họ chỉ là người mua cuối cùng và "tóm tắt các cuộc thảo luận công khai". Tòa án không coi lập luận này là đủ để bác bỏ vụ kiện. Đây là tín hiệu trực tiếp cho tất cả những ai mua các bộ dữ liệu sẵn có: nguồn gốc của dữ liệu sẽ phải được giải thích.
  3. Hợp đồng và ToS sống tách biệt với DMCA. Ngay cả khi lý thuyết bản quyền tan vỡ, vi phạm điều khoản sử dụng vẫn là cơ sở độc lập. Thua kiện theo DMCA không có nghĩa là việc thu thập dữ liệu "được tòa án cho phép".
  4. Lớp hạ tầng đã trở nên rõ ràng với nguyên đơn. Khi các nhà cung cấp proxy trở thành bị đơn, câu hỏi "nhà cung cấp của tôi biết và ghi lại gì về lưu lượng của tôi" không còn là sự hoang tưởng. Hãy chọn nhà cung cấp có nguồn gốc rõ ràng, có chính sách sử dụng hợp lý và KYC — đó chính là phần giấy tờ nhàm chán phân biệt đối tác hạ tầng với người tham gia vào kế hoạch của người khác. Chúng tôi đã viết về các tiêu chí trong bài phân tích các thực tiễn hợp pháp trong việc thu thập dữ liệu qua proxy.
  5. Phân chia nhiệm vụ theo mức độ rủi ro. Giám sát giá cả, kiểm tra kết quả, kiểm soát tính khả dụng của các tài nguyên của riêng bạn và kiểm tra địa lý — là những kịch bản điển hình với hồ sơ pháp lý có thể dự đoán; cho chúng phù hợp với proxy cư trú hoặc các địa chỉ trung tâm dữ liệu rẻ tiền, nếu nền tảng không yêu cầu nguồn gốc "cư trú". Việc thu thập hàng loạt nội dung bản quyền của người khác để đào tạo mô hình — là một kịch bản hiện đang chuyển sang các phòng xử án, và cần phải giải quyết bằng giấy phép, không phải bằng việc xoay vòng IP.

Tóm tắt

Hai tòa án liên bang trong mười một ngày đã có những đánh giá khác nhau về cùng một hành động vượt qua cùng một rào cản. California: vượt qua bảo vệ tìm kiếm mà không có bản quyền đứng sau — không vi phạm DMCA. New York: nếu phía sau rào cản là nội dung người dùng được bảo vệ, thì cáo buộc chống vượt qua có quyền được xem xét, cùng với nó — các cáo buộc đối với các trung gian và người mua dữ liệu.

Đối với những ai làm việc với dữ liệu một cách chuyên nghiệp, có một kết luận: khía cạnh kỹ thuật của việc thu thập đã không còn là yếu tố rủi ro chính. Điều chính giờ đây là vấn đề về quyền sở hữu những gì bạn lấy, và tính minh bạch của chuỗi cung ứng mà qua đó dữ liệu đến tay bạn. Cột mốc tiếp theo trong vụ án — đơn yêu cầu của Oxylabs, mà tòa án đã làm đông lại sau quyết định về các bị đơn.

```