Vào đầu tháng 8 năm 2026, hàng chục người mua sắm trên Amazon phát hiện rằng họ chỉ thấy tám đánh giá trên thẻ sản phẩm — không có phân loại, không có bộ lọc, không có khả năng mở các đánh giá khác. Không có bất kỳ cảnh báo nào. Dịch vụ hỗ trợ giải thích rằng điều này xảy ra do vi phạm điều khoản sử dụng "liên quan đến việc thu thập và trích xuất nội dung của cộng đồng". Nói cách khác, nền tảng đã nhầm lẫn những người dùng thực với các công cụ thu thập dữ liệu.
Câu chuyện sẽ chỉ là một sự cố hài hước nếu không trùng hợp với một sự kiện khác: vào ngày 4 tháng 8 năm 2026, Tòa án Phúc thẩm khu vực chín đã hủy bỏ lệnh cấm mà Amazon áp đặt đối với đại lý AI Perplexity Comet. Con đường pháp lý để chống lại tự động hóa đã bị trục trặc — và gần như đồng thời, con đường kỹ thuật đã trở nên nghiêm ngặt hơn. Chúng ta hãy cùng phân tích điều gì đã xảy ra và tại sao điều này lại thay đổi quy tắc chơi cho tất cả những ai thu thập dữ liệu công khai.
Điều gì đã xảy ra: tám đánh giá và kháng cáo năm ngày
Về các hạn chế hàng loạt, TechSpot, Android Authority và Shopifreaks đã báo cáo vào ngày 3-4 tháng 8 năm 2026. Tình hình của những người bị ảnh hưởng là giống nhau:
- trên bất kỳ sản phẩm nào chỉ có 8 đánh giá thay vì danh sách đầy đủ;
- các công cụ phân loại và lọc đánh giá biến mất;
- không có thông báo về hạn chế — người dùng tự phát hiện ra điều này;
- để gỡ bỏ lệnh cấm, cần phải viết cho bộ phận hỗ trợ và chờ phản hồi trong tối đa năm ngày làm việc.
Một trong những người bị ảnh hưởng, Fred Hall, đã gặp phải hạn chế vào giữa tháng 7 khi đang nghiên cứu về máy hút ẩm. Nhân viên hỗ trợ qua trò chuyện đã viện dẫn vi phạm Điều khoản Sử dụng liên quan đến việc trích xuất nội dung của người dùng; kháng cáo đã được chấp thuận sau vài ngày mà không có bất kỳ giải thích nào. Trường hợp thứ hai thì đáng chú ý hơn: Sean Kaufman đã nhận cùng một giới hạn tám đánh giá trên tất cả các sản phẩm liên tiếp. Anh không sử dụng VPN, không có trình chặn quảng cáo, cũng như không sử dụng trình duyệt AI — điều duy nhất khác biệt là anh thường so sánh các sản phẩm cạnh tranh và đọc kỹ các đánh giá. Amazon đã đề nghị anh 10 đô la vào tài khoản, và quyền truy cập đã được khôi phục sau năm ngày.
Phát biểu chính thức của công ty như sau: "Chúng tôi hiểu rằng có thể đã xảy ra một số trường hợp mà khách hàng không thể truy cập vào các đánh giá, và chúng tôi đã làm việc để đảm bảo quyền truy cập." Tuy nhiên, Amazon đã từ chối tiết lộ bất kỳ chi tiết quan trọng nào: không có số lượng tài khoản bị ảnh hưởng, không có hành vi nào kích hoạt bộ phát hiện, không có ngày bắt đầu của các hạn chế, và không có nguyên tắc xem xét kháng cáo. Các khiếu nại riêng lẻ, theo các cuộc thảo luận, đã xuất hiện từ tháng 11 năm 2025 — tức là cơ chế này đã hoạt động từ lâu, và chỉ đến tháng 8 mới trở nên rõ ràng.
Tại sao lại là bây giờ: tòa án đã tước đi công cụ tiện lợi của Amazon
Để hiểu bối cảnh, cần có một dòng thời gian về cuộc xung đột giữa Amazon và Perplexity.
- Tháng 11 năm 2024 — tháng 11 năm 2025. Amazon, theo tuyên bố của mình, đã gửi cho Perplexity ít nhất năm cảnh báo yêu cầu ngừng việc mua hàng đại diện cho người dùng.
- Tháng 8 năm 2025. Amazon đặt rào cản kỹ thuật chống lại Comet. Theo Amazon, Perplexity đã phát hành một cách vượt qua trong vòng 24 giờ, ngụy trang đại lý của mình thành một phiên làm việc thông thường trên Chrome thay vì tự giới thiệu một cách trung thực.
- Ngày 10 tháng 3 năm 2026. Thẩm phán Maxine Chesney tại San Francisco đã ban hành lệnh cấm tạm thời: Comet không thể truy cập vào các phần của Amazon được bảo vệ bằng mật khẩu và mua hàng cho người dùng. Câu nói then chốt là — đại lý hoạt động "với sự cho phép của người dùng Amazon, nhưng không có sự ủy quyền từ Amazon".
- Ngày 4 tháng 8 năm 2026. Khu vực chín đã hủy bỏ lệnh cấm. Tòa án cho rằng Amazon khó có thể thắng kiện theo Đạo luật Gian lận và Lạm dụng Máy tính: khi người dùng giao cho trợ lý một nhiệm vụ, máy chủ của Amazon được truy cập bởi chính người dùng thông qua trợ lý, chứ không phải Perplexity. CFAA yêu cầu chứng minh quyền truy cập không được phép có chủ ý và thiệt hại trên 5000 đô la mỗi năm — tòa án không thấy các yếu tố này.
Amazon đã phản hồi rằng "tôn trọng không đồng ý" với quyết định và giữ quyền yêu cầu xem xét lại. Vụ việc tại tòa án San Francisco vẫn chưa được đóng lại — chỉ có lệnh cấm tạm thời bị hủy bỏ. Nhưng tín hiệu đã được phát đi cho thị trường: nỗ lực để coi hành động của đại lý, hoạt động theo sự chỉ đạo trực tiếp của con người, như một hành vi xâm nhập trong các vụ kiện vẫn chưa thành công.
Perplexity, trong suốt thời gian này, đã khẳng định rằng vụ kiện không bảo vệ an ninh, mà bảo vệ doanh thu quảng cáo: đại lý mua hàng mà không qua quảng cáo mà người dùng nhìn thấy. Lập luận này không phải là không có cơ sở: doanh nghiệp quảng cáo của Amazon được định giá 56 tỷ đô la vào năm 2025, và toàn bộ doanh thu này phụ thuộc vào việc người mua sống xem cửa hàng một cách trực tiếp.
Điều gì còn lại cho nền tảng khi tòa án không giúp đỡ
Amazon từ lâu đã chiến đấu trên hai mặt trận. Ngoài các vụ kiện, công ty liên tục đóng cửa quyền truy cập cho các công cụ thu thập dữ liệu AI thông qua robots.txt: trong danh sách bị chặn có các bot của Meta, Google, Huawei và Mistral, và trước đó là các công cụ thu thập dữ liệu của Anthropic, Perplexity và Google Project Mariner. Để so sánh: Walmart và eBay không áp dụng các chặn tương tự trong robots.txt. Vấn đề là robots.txt chỉ là một yêu cầu, không phải là rào cản: nó chỉ hoạt động với những ai tự nguyện tuân thủ.
Do đó, bước đi hợp lý là chuyển bảo vệ lên cấp độ mà không cần phải hỏi ý kiến. Đó chính là câu chuyện với các đánh giá: thay vì chặn các bot cụ thể theo tên, nền tảng bắt đầu đánh giá hành vi phiên làm việc và cắt giảm kết quả cho những người có mẫu hành vi giống như máy móc. Các đánh giá là tài sản quý giá nhất và dễ sao chép nhất của thị trường, vì vậy thí nghiệm bắt đầu từ chúng.
Vấn đề thực tế của cách tiếp cận này là các báo động giả. Phân loại hành vi dựa trên động lực tương tác: nhịp độ và tốc độ di chuyển, khoảng dừng, trình tự chuyển tiếp, độ sâu và sự lặp lại của các lượt xem. Một người so sánh một cách có hệ thống mười mẫu máy hút ẩm và mở tất cả các đánh giá của từng mẫu, theo các chỉ số này, trông giống như một trình phân tích. Trường hợp của Kaufman là một minh họa điển hình: địa chỉ IP sạch, trình duyệt thông thường, không có tự động hóa, và vẫn bị cấm.
Kết luận chính: địa chỉ IP sạch không còn là vé vào cửa
Đối với những ai thu thập dữ liệu công khai, câu chuyện này mang đến một điều không vui. Trước đây, logic rất đơn giản: danh tiếng của IP kém — bị chặn, danh tiếng tốt — có quyền truy cập. Giờ đây, Amazon đã cho thấy rằng quyết định có thể được đưa ra mặc dù có tín hiệu mạng hoàn hảo. Người dùng ngồi từ nhà cung cấp dịch vụ tại nhà, từ quốc gia của mình, trong Chrome thực sự, với toàn bộ lịch sử mua sắm trong nhiều năm — và vẫn bị hạn chế, vì đọc quá nhiều đánh giá liên tiếp.
Điều này thay đổi các ưu tiên trong cơ sở hạ tầng thu thập dữ liệu. Một proxy dân cư chất lượng vẫn cần thiết — nếu không có nó, bạn sẽ không vượt qua được ngay cả lớp lọc đầu tiên và không thấy được kết quả giống như người mua địa phương. Nhưng nó không còn là điều kiện đủ: nếu trên một địa chỉ IP tốt có một robot với nhịp độ máy móc, bộ phát hiện sẽ bắt bạn ở lớp thứ hai. Phân tích chi tiết về cách hoạt động của lớp này có trong tài liệu của chúng tôi về sinh trắc học hành vi và proxy.
Phải làm gì trên thực tế
- Phân tách "cá nhân" và "công việc" về mặt vật lý. Nếu bạn theo dõi giá cả và đánh giá của đối thủ từ cùng một trình duyệt và cùng một địa chỉ IP mà bạn đăng nhập vào tài khoản mua sắm của mình, bạn đang gặp rủi ro cho cả dữ liệu và tài khoản. Một hồ sơ riêng biệt, một địa chỉ đầu ra riêng biệt, một phiên làm việc riêng biệt.
- Một nhóm — một nhiệm vụ. Theo dõi Buy Box, thu thập đánh giá và kiểm tra tình trạng không nên đi qua cùng một tập hợp địa chỉ: những nhiệm vụ này có mẫu yêu cầu khác nhau, và việc trộn lẫn chúng có nghĩa là thu thập một dấu vân tay tổng hợp, dễ nhận thấy hơn bất kỳ thành phần nào.
- Giới hạn độ sâu trên mỗi phiên làm việc. Tám đánh giá không phải là một con số ngẫu nhiên: đó là ngưỡng mà nền tảng coi là sự quan tâm bình thường. Hãy thu thập đánh giá theo từng phần thông qua các phiên khác nhau thay vì kéo toàn bộ luồng trong một lần.
- Giữ nhịp độ con người. Các khoảng dừng ngẫu nhiên, tốc độ chuyển tiếp không đồng đều, trình tự tự nhiên (thẻ sản phẩm → đánh giá → quay lại kết quả) rẻ hơn so với việc quay vòng hàng ngàn địa chỉ trong hàng loạt yêu cầu.
- Theo dõi sự suy giảm, không chỉ lỗi. Điều đáng ngại nhất trong cách tiếp cận của Amazon là — bạn không nhận được mã 403. Bạn nhận được HTTP 200 với nội dung bị cắt giảm. Một trình phân tích chỉ kiểm tra mã phản hồi sẽ viết vào cơ sở dữ liệu tám đánh giá từ ba nghìn trong nhiều tháng mà không đưa ra bất kỳ tín hiệu cảnh báo nào. Hãy thêm kiểm tra độ đầy đủ: số lượng phần tử, sự hiện diện của phân trang, sự có mặt của khối bộ lọc.
- Đặt dự phòng. Theo dữ liệu từ nghiên cứu State of Web Scraping 2026 (Apify và The Web Scraping Club), 65,8% chuyên gia đã sử dụng nhiều proxy hơn so với năm trước, trong khi 58,3% đã tăng ngân sách — trong khi giá cho mỗi gigabyte nhìn chung đã giảm. Không phải giá cả tăng, mà là khối lượng và độ phức tạp cần thiết. 43,1% đội ngũ hiện giữ từ 2-3 nhà cung cấp để đảm bảo tính khả dụng.
Cần nhớ rằng có một xu hướng ngược lại: trong khi một số nền tảng che giấu các bộ lọc, ngành công nghiệp đang cố gắng hợp pháp hóa các bot "tốt" — thông qua chữ ký mã hóa của các yêu cầu và nhận dạng rõ ràng của đại lý. Chúng tôi đã phân tích cách thức hoạt động của điều này trong bài viết về Web Bot Auth và các đại lý đã ký. Vấn đề là đại lý đã ký theo định nghĩa sẽ tự giao mình cho nền tảng: Amazon sẽ vui vẻ biết rằng trước mặt mình là một bot — và sẽ từ chối.
Ai sẽ bị ảnh hưởng trong những tháng tới
Việc cắt giảm nhẹ nhàng kết quả thay vì chặn thẳng thừng — là một chiêu thức dễ sao chép. Có khả năng cao chúng ta sẽ thấy điều này ở các nền tảng khác: nó rẻ hơn captcha, không làm hỏng các chỉ số thoát và không cung cấp cho scraper tín hiệu rõ ràng rằng họ đã bị phát hiện.
Các kịch bản có nguy cơ cao nhất là những nơi mà độ đầy đủ của dữ liệu quan trọng hơn chỉ việc có quyền truy cập: phân tích đánh giá cho phân tích sản phẩm, giám sát danh tiếng, đào tạo mô hình trên nội dung người dùng, tình báo cạnh tranh của các nhà bán hàng. Nếu bạn làm việc với thị trường, hãy đọc lại các thực hành cơ bản để vượt qua các bộ lọc — chẳng hạn như phân tích của chúng tôi về bảo vệ chống bot của Amazon khi phân tích giá — và thêm vào đó kiểm tra độ không đầy đủ của phản hồi.
Điều này cũng ảnh hưởng đến những người bình thường. Người dùng bị nhầm lẫn với bot mất đi chính chức năng mà họ đến với thị trường: khả năng đọc những gì người khác nói về sản phẩm. Không có cảnh báo, không có giải thích, không có thời gian khôi phục rõ ràng — chỉ có một bức thư gửi đến bộ phận hỗ trợ và năm ngày chờ đợi.
Kết luận
Tháng 8 năm 2026 đã ghi nhận một ngã rẽ. Tòa án khu vực chín thực tế đã nói: đại lý hoạt động theo sự chỉ đạo của con người — đó là con người, và không thể áp dụng luật về lạm dụng máy tính đối với họ. Các nền tảng đã hiểu câu trả lời và chuyển cuộc chiến đến nơi mà các quyết định được đưa ra mà không cần tòa án — vào các bộ lọc hành vi của chính giao diện người dùng. Thiệt hại phụ dưới dạng những người mua sống với giới hạn tám đánh giá dường như không làm Amazon quá lo lắng, theo các bình luận.
Kết luận cho thực tiễn là đơn giản: cơ sở hạ tầng thu thập dữ liệu không còn là nhiệm vụ "tìm kiếm một địa chỉ IP tốt". Địa chỉ IP tốt là vé vào cửa, và sau đó bạn sẽ được đánh giá dựa trên cách bạn hành xử và số lượng yêu cầu bạn đưa ra. Hãy lập kế hoạch ngân sách, độ sâu yêu cầu và kiểm soát độ đầy đủ của phản hồi dựa trên điều này — và kiểm tra không chỉ xem dữ liệu đã đến hay chưa, mà còn xem số lượng dữ liệu đã đến có đúng như dự kiến hay không.
```