Quay lại blog

BOTS ĐANG VƯỢT QUA NGƯỜI MUA 10:1: CUỘC CHIẾN VỚI CÁC SCALPER DDR5 ẢNH HƯỞNG ĐẾN VIỆC THEO DÕI GIÁ HỢP PHÁP NHƯ THẾ NÀO

Ngày 21 tháng 8 năm 2026, DataDome thông báo: các bot tạo ra 91% lưu lượng truy cập trên các thẻ DDR5 của một nhà bán lẻ lớn — khoảng mười yêu cầu tự động cho mỗi lượt truy cập thực, so với 6:1 vào mùa xuân. Chúng ta cùng phân tích các con số với những lưu ý, chỉ ra lý do tại sao chữ ký hành vi của bot scalper lại trùng với chữ ký của việc theo dõi giá thông thường, và những gì cần thay đổi trong việc thu thập dữ liệu.

📅24 tháng 8, 2026
BOTS ĐANG VƯỢT QUA NGƯỜI MUA 10:1: CUỘC CHIẾN VỚI CÁC SCALPER DDR5 ẢNH HƯỞNG ĐẾN VIỆC THEO DÕI GIÁ HỢP PHÁP NHƯ THẾ NÀO
```html

Ngày 21 tháng 8 năm 2026, Jérôme Segura, phó chủ tịch nghiên cứu mối đe dọa tại công ty chống bot DataDome, đã công bố một con số mà trong vòng một ngày đã lan truyền qua các ấn phẩm lớn: trên các thẻ bộ nhớ DDR5 của một nhà bán lẻ lớn, bot chiếm 91% toàn bộ lưu lượng truy cập — khoảng mười yêu cầu tự động cho mỗi lượt truy cập thực. Vào mùa xuân, tỷ lệ này là 6:1. Chỉ trong vài tháng, áp lực từ tự động hóa lên các trang sản phẩm đã tăng gần gấp đôi.

Đối với những người thu thập giá cả và tình trạng hàng hóa một cách hợp pháp — tái định giá, kiểm soát MAP, phân tích danh mục — đây là một tin xấu không phải vì "các đối thủ scalper vượt qua". Mà vì, giờ đây, các nhà bán lẻ đang điều chỉnh bảo vệ theo hồ sơ hành vi mà việc theo dõi giá thông thường và bot scalper trông giống nhau.

Điều gì đã được phát hiện và mức độ tin cậy của nó

Thông tin công khai được xây dựng từ hai báo cáo của DataDome. Phân tích tháng Ba đã cung cấp chi tiết về một chiến dịch: hơn 50.000 yêu cầu mỗi giờ, 91 mặt hàng được theo dõi, trung bình 551 yêu cầu cho mỗi thẻ sản phẩm — tức là kiểm tra tình trạng hàng hóa mỗi 6,5 giây. Một hoạt động đã thực hiện hơn 10 triệu yêu cầu trước khi bị chặn. Cập nhật tháng Tám đã bổ sung thêm tỷ lệ: 91% lưu lượng truy cập và tỷ lệ 10:1.

Giờ đây, những lưu ý quan trọng, nếu không có chúng, con số sẽ trở thành tiếng ồn tiếp thị:

  • Đây là một nhà bán lẻ chưa được nêu tên, chứ không phải là một mẫu thị trường.
  • DataDome không công bố khoảng thời gian lấy mẫu và phương pháp — điều gì được coi là "bot xấu" vẫn nằm trong sự quyết định của họ.
  • Công ty bán một sản phẩm chặn chính xác lưu lượng này. Xung đột lợi ích không hủy bỏ dữ liệu, nhưng yêu cầu điều chỉnh.
  • Điều quan trọng: các yêu cầu đến trang không phải là mua hàng. Chỉ số này cho thấy áp lực của việc theo dõi lên danh sách, chứ không phải tỷ lệ hàng hóa thực sự được bot mua.

Điểm cuối cùng quan trọng hơn tất cả các điểm khác. 91% "lưu lượng bot" không phải là 91% scalper. Trong tỷ lệ này bao gồm tất cả tự động: các aggregator giá, các dịch vụ tái định giá của bên thứ ba, dịch vụ theo dõi giảm giá, các crawler phân tích và việc theo dõi của chính bạn. Nhà bán lẻ thấy một khối lượng chung và phản ứng với nó bằng một quy tắc chung.

Tại sao điều này lại xảy ra: bộ nhớ trở thành tài sản khan hiếm

Ngữ cảnh rất đơn giản. Bộ 32 GB DDR5-6000, cách đây một năm có giá khoảng $72, vào tháng Tám được bán với giá trung bình $392. Các bộ 64 GB đã tăng giá khoảng 485%, lên $1118. Giá chip DDR4 trên thị trường vào đầu tháng Tám đã lập kỷ lục — $42,45. Các bộ 128 GB hàng đầu đã tăng gần gấp mười lần. Nguyên nhân không phải do các thanh chơi game: công suất sản xuất đang được dọn dẹp bởi các bộ tăng tốc AI, HBM và bộ nhớ máy chủ — theo dự báo ngành, các trung tâm dữ liệu sẽ chiếm khoảng 70% sản lượng toàn cầu của các chip nhớ vào năm 2026, và tình trạng thiếu hụt sẽ kéo dài ít nhất đến quý IV năm 2027.

Khi hàng hóa tăng giá gấp năm lần và biến mất khỏi kệ, sự khác biệt giữa giá bán lẻ và giá bán lại biện minh cho bất kỳ cơ sở hạ tầng nào cho việc mua đi bán lại. Từ đó, cường độ tăng lên. Hơn nữa, các mục tiêu đã vượt ra ngoài bán lẻ tiêu dùng: tự động hóa đang tấn công các trang của các nhà cung cấp như Micron và Apacer, cũng như các nhà sản xuất DIMM và CAMM2 — Amphenol, TE Connectivity. Các nhà buôn đã tiến lên phía trên chuỗi cung ứng.

Chữ ký khiến việc theo dõi hợp pháp gặp khó khăn

Dưới đây là mô tả hành vi của bot từ báo cáo của DataDome — hãy đọc nó như một danh sách kiểm tra cho scraper của riêng bạn:

  • Vượt qua bộ nhớ cache. Mỗi yêu cầu HTTP được thêm một tham số duy nhất để nhận được trang mới, chứ không phải là phản hồi từ CDN.
  • Nhịp độ giống con người. Hồ sơ tải trọng ngày và đêm, giả lập giờ hoạt động thông thường.
  • Tốc độ hơi dưới ngưỡng. Tần suất được điều chỉnh để không kích hoạt các cảnh báo về lưu lượng.
  • Phiên phẳng. Truy cập vào một thẻ sản phẩm — và thoát ra. Không có giỏ hàng, không tìm kiếm, không chuyển đổi qua danh mục.

Giờ hãy nhìn vào việc theo dõi giá doanh nghiệp điển hình. Nó đi qua các liên kết trực tiếp đến SKU từ cơ sở dữ liệu của nó. Nó thêm tham số để không bị bắt gặp giá đã được lưu vào bộ nhớ cache từ ngày hôm qua. Nó hoạt động với khoảng thời gian cố định, được điều chỉnh bằng cách thử nghiệm "để không bị cấm". Và nó không bao giờ đặt gì vào giỏ hàng. Đó là cùng một chữ ký. Sự khác biệt chỉ nằm ở ý định, mà động cơ chống bot không đo lường được.

Kết luận thực tiễn không dễ chịu: việc thắt chặt bảo vệ chống lại scalper tự động sẽ ảnh hưởng đến việc thu thập dữ liệu hợp pháp, và không có ai để "giải thích" ở đây. Chúng tôi đã thảo luận về hiệu ứng tương tự trên một nền tảng khác — khi Amazon bắt đầu đánh dấu người mua thông thường là bot do các ngưỡng hành vi, chứ không phải do IP.

Những gì cần thay đổi trong việc thu thập dữ liệu của bạn ngay bây giờ

Việc thay đổi nhóm IP ở đây ít giúp ích: tín hiệu đến từ hành vi, không phải địa chỉ. Quy trình làm việc thực sự giảm tỷ lệ bị chặn:

  1. Loại bỏ nhịp đều. Yêu cầu mỗi 6,5 giây với độ chính xác của một chiếc métronome — không phải "giống con người", mà là một chữ ký. Cần có jitter trong khoảng rộng (ví dụ, 20–180 giây cho một vị trí) và phân phối khác nhau theo các ngày trong tuần.
  2. Ngừng phá vỡ bộ nhớ cache ở mỗi yêu cầu. Một cache-buster duy nhất trong URL — dấu hiệu rẻ nhất của tự động hóa. Cần kiểm tra tính mới một cách chọn lọc và chỉ với các SKU biến động, còn lại lấy như hiện có.
  3. Cung cấp chiều sâu cho phiên. Vào qua danh mục hoặc tìm kiếm, một hoặc hai sản phẩm lân cận, chỉ sau đó là thẻ sản phẩm mục tiêu. Tốn kém hơn về lưu lượng, nhưng loại bỏ hồ sơ "phẳng".
  4. Ưu tiên SKU theo độ biến động. Hàng hóa có giá thay đổi mỗi tuần không cần được hỏi mỗi nửa phút. Tần suất nên theo sự thay đổi, không phải theo kích thước danh sách.
  5. Chia nhóm theo loại nhiệm vụ. Theo dõi bán lẻ, kiểm tra kết quả và thu thập phản hồi không nên đến từ cùng một địa chỉ: việc kích hoạt bảo vệ trên một kịch bản không nên giết chết các kịch bản khác. Đối với các thẻ sản phẩm của các chuỗi lớn, proxy cư trú hoạt động ổn định nhất, trong khi nhóm trung tâm dữ liệu nên được giữ lại cho các API công khai và các kiểm tra riêng.
  6. Đếm không phải là gigabyte, mà là các bản ghi thành công. Khi bảo vệ được thắt chặt, tỷ lệ các yêu cầu lại tăng lên, và giá cho mỗi gigabyte không còn phản ánh thực tế — tại sao $/GB không đúng và cách tính chi phí của một bản ghi thành công, chúng tôi đã phân tích riêng. Trong điều kiện mà 9 trong 10 yêu cầu đến danh sách là tự động, chỉ số "chi phí giá hợp lệ trong cơ sở" trở thành chỉ số duy nhất công bằng.

Làm thế nào để biết rằng bạn đã bị cắt giảm

Việc chặn trên các trang sản phẩm hiếm khi trông giống như một từ chối công bằng. Thường thì nó âm thầm, và việc theo dõi tiếp tục ghi vào cơ sở dữ liệu những thứ rác rưởi. Những dấu hiệu mà điều này có thể bị phát hiện:

  • Tăng tỷ lệ 429 và 403 trong khi khối lượng nhiệm vụ không thay đổi — chỉ số đơn giản nhất, nếu bạn thực sự ghi lại mã phản hồi trong nhật ký, chứ không chỉ là kết quả phân tích.
  • Luôn có "không có hàng". Phản hồi mềm cổ điển: trang được trả về, giá vẫn ở đó, nhưng khối lượng hàng hóa đã bị thay thế. Việc theo dõi thấy HTML hợp lệ và không nâng cao cảnh báo.
  • Giá "dính lại". Phiên bản đã được lưu vào bộ nhớ cache từ một tuần trước được trả về — hiệu ứng tương tự mà bot đã bắt đầu phá vỡ bộ nhớ cache bằng các tham số.
  • Tăng độ trễ phản hồi chỉ trên các thẻ sản phẩm, trong khi các danh mục và tìm kiếm mở bình thường: phân đoạn nghi ngờ đã được kích hoạt throttling.
  • Phân tán đột ngột trong mẫu. Nếu dữ liệu của một số SKU được cập nhật, trong khi một số khác bị kẹt lại — bạn đã một phần nằm trong bộ lọc, chỉ không hoàn toàn.

Thực tiễn làm việc — giữ một vài sản phẩm "kiểm soát", mà giá có thể được kiểm tra thủ công hoặc từ nguồn độc lập thứ hai, và so sánh chúng mỗi ngày. Sự khác biệt giữa nhóm kiểm soát với những gì thấy trong trình duyệt có nghĩa là cần sửa chữa không phải là parser, mà là hồ sơ truy cập.

Tại sao chỉ việc xoay vòng IP không còn giải quyết được vấn đề

Nguyên nhân mà việc thay đổi địa chỉ ngày càng ít hiệu quả là vì quyết định chặn được đưa ra dựa trên nhiều lớp cùng một lúc, và IP chỉ là lớp đầu tiên trong số đó.

  • Lớp mạng. Danh tiếng của địa chỉ và hệ thống tự trị, tỷ lệ các dải trung tâm dữ liệu, mật độ yêu cầu từ một subnet. Ở đây, việc xoay vòng thực sự giúp ích.
  • Lớp giao thông và khách hàng. Dấu vân tay TLS, thứ tự tiêu đề, phiên bản khách hàng. Thư viện năm 2021 với sự kết hợp mã hóa hiếm sẽ tự tiết lộ trước khi đến được logic kinh doanh.
  • Lớp hành vi. Chính lớp mà DataDome đã mô tả: khoảng thời gian, chiều sâu phiên, không có giỏ hàng và tìm kiếm, cache-buster. Lớp này hoàn toàn không gắn liền với IP — có thể thay đổi địa chỉ ở mỗi yêu cầu và vẫn là cùng một bot.

Từ đó, câu nói chính của câu chuyện tháng Tám: đầu tư vào chất lượng nhóm chỉ mang lại lợi ích khi kết hợp với việc sửa chữa hành vi. Riêng lẻ cái đầu tiên — là việc thanh toán cho lưu lượng mà vẫn sẽ bị lọc ở lớp thứ ba.

Điều này sẽ đi đâu tiếp theo

Tình trạng thiếu hụt bộ nhớ sẽ kéo dài nhiều năm, có nghĩa là áp lực lên các thẻ sản phẩm sẽ không giảm. Các nhà bán lẻ sẽ phản ứng một cách rõ ràng: giới hạn mua hàng, xếp hàng, yêu cầu xác thực để xem tình trạng hàng hóa, điểm số hành vi thay vì các giới hạn đơn giản theo IP. Một phần trong số các biện pháp này đã trở thành tiêu chuẩn trong các lĩnh vực vé và giày thể thao — giờ đây chúng đang đến với phần cứng máy tính và, xa hơn nữa, với các thành phần công nghiệp.

Đối với các đội ngũ sống dựa vào dữ liệu bên ngoài, điều này có nghĩa là thay đổi cách tiếp cận: kỷ nguyên "đặt xoay vòng IP và thu thập" đã kết thúc ở nơi hàng hóa khan hiếm. Điều hiệu quả là nhịp độ thực tế, chiều sâu phiên có ý nghĩa, phân chia nhóm và tính toán chi phí kết quả một cách tỉnh táo. Nếu bạn chỉ mới xây dựng việc thu thập giá, hãy bắt đầu với sơ đồ cơ bản từ phân tích của chúng tôi proxy cho thương mại điện tử: thu thập giá và theo dõi đối thủ, và sau đó áp dụng các điều chỉnh hành vi từ tài liệu này.

Và cuối cùng. Con số 91% tự nó — là tín hiệu không phải về việc có quá nhiều bot, mà về việc các trang sản phẩm của hàng hóa khan hiếm đã trở thành một lĩnh vực mà tự động hóa cạnh tranh với tự động hóa. Người chiến thắng trong môi trường như vậy không phải là người hỏi nhiều hơn, mà là người ít bị lọc hơn.

```