← Quay lại blog

Giá để theo dõi 10.000 sản phẩm mỗi tháng: Tính toán lưu lượng truy cập và lựa chọn proxy

Phân tích lượng lưu lượng thực sự cần thiết để giám sát 10.000 sản phẩm mỗi tháng, cách chọn loại proxy phù hợp với khối lượng và không phải trả quá nhiều cho việc thu thập giá của đối thủ.

📅23 tháng 9, 2026

Các nhà bán hàng trên Wildberries và Ozon thường ước lượng ngân sách cho proxy "bằng mắt" — và hoặc là trả quá nhiều gấp 3-4 lần, hoặc mua gói quá rẻ, hết hạn chỉ sau một tuần. Hãy cùng phân tích cách tính toán chính xác khối lượng lưu lượng cho việc theo dõi 10.000 sản phẩm mỗi tháng, loại proxy nào nên chọn cho khối lượng này và những gì có thể tiết kiệm mà không làm giảm chất lượng dữ liệu.

Tại sao phải theo dõi 10.000 sản phẩm, chứ không phải 100

Nếu bạn có 100-200 sản phẩm, có thể kiểm tra giá của đối thủ bằng tay một lần mỗi ngày. Nhưng khi danh mục tăng lên đến hàng nghìn SKU, và các đối thủ thay đổi giá từ 5-10 lần mỗi ngày (đặc biệt trong các chương trình khuyến mãi của Wildberries và Ozon), việc theo dõi bằng tay trở thành một điều không thể — dữ liệu lỗi thời nhanh hơn bạn có thể thu thập.

10.000 sản phẩm là khối lượng điển hình cho một nhà bán hàng trung bình với nhiều danh mục hoặc một đại lý, người theo dõi cho 5-10 khách hàng cùng lúc. Để đạt được quy mô như vậy, cần có tự động hóa: một kịch bản hoặc dịch vụ thu thập dữ liệu sẵn có, liên tục truy cập vào thẻ sản phẩm, trang danh mục và API của các thị trường hàng chục nghìn lần mỗi ngày. Và đây là câu hỏi chính — qua cái gì để gửi những yêu cầu này, để không bị chặn IP ngay trong hai giờ làm việc đầu tiên.

Wildberries, Ozon và Avito đang tích cực bảo vệ chống lại việc thu thập dữ liệu: họ đặt captcha, giảm tốc độ phản hồi, chặn IP của các trung tâm dữ liệu hàng loạt. Do đó, ngân sách cho việc theo dõi không chỉ là chi phí cho máy chủ và phát triển, mà còn là một khoản chi phí riêng cho proxy, và thường là khoản không thể đoán trước nhất, nếu tính toán "bằng mắt".

Cần bao nhiêu yêu cầu thực sự mỗi tháng

Bước đầu tiên trong việc tính toán ngân sách là hiểu rõ bạn cần thực hiện bao nhiêu yêu cầu HTTP. Điều này phụ thuộc vào tần suất cập nhật giá mà bạn đặt ra trong chiến lược theo dõi.

Tần suất cập nhật Yêu cầu cho 1 sản phẩm mỗi tháng Yêu cầu cho 10.000 sản phẩm
1 lần mỗi ngày 30 300.000
4 lần mỗi ngày 120 1.200.000
1 lần mỗi giờ (24 lần mỗi ngày) 720 7.200.000

Đối với hầu hết các nhà bán hàng trên Wildberries và Ozon, 4-6 lần cập nhật mỗi ngày là đủ — điều này bao phủ các cuộc chiến giá vào buổi sáng và buổi tối mà không tạo ra quá tải cho nhóm proxy. Việc theo dõi hàng giờ chỉ cần thiết trong các lĩnh vực cạnh tranh cao (điện tử, mỹ phẩm) trong các chương trình khuyến mãi lớn như "Ngày thứ Sáu đen tối".

Công thức tính toán lưu lượng

Lưu lượng mà proxy "tốn" không chỉ phụ thuộc vào số lượng yêu cầu, mà còn vào việc bạn đang thu thập gì: thẻ sản phẩm hoàn chỉnh (trang HTML với hình ảnh và script) hay chỉ là phản hồi JSON từ API của thị trường.

Công thức:

Lưu lượng (GB) = Số lượng yêu cầu × Trọng lượng trung bình của phản hồi (KB) / 1.048.576

Trọng lượng trung bình của phản hồi khác nhau rất nhiều tùy thuộc vào phương pháp:

  • Yêu cầu đến API của thẻ sản phẩm (JSON) — 15-60 KB cho mỗi phản hồi
  • Trang HTML hoàn chỉnh của thẻ sản phẩm — 300-900 KB cho mỗi phản hồi
  • Trang danh mục/tìm kiếm có phân trang — 500-1500 KB cho mỗi phản hồi

Nếu bạn thu thập dữ liệu trực tiếp qua các API nội bộ của thị trường (điều này được ưu tiên — trọng lượng thấp hơn, tốc độ cao hơn, rủi ro captcha thấp hơn), cho 10.000 sản phẩm với 4 lần cập nhật mỗi ngày, ta có 1.200.000 yêu cầu × 40 KB ≈ 45,8 GB lưu lượng mỗi tháng. Nếu thu thập các trang HTML hoàn chỉnh, cùng số lượng yêu cầu "tốn" đã 600-900 GB — sự khác biệt lên đến 15-20 lần chỉ nhờ vào phương pháp thu thập dữ liệu.

Proxy trung tâm dữ liệu, proxy cư trú và proxy di động: nên chọn cái nào

Loại proxy ảnh hưởng trực tiếp đến chi phí và tỷ lệ yêu cầu thành công (success rate). Đối với việc theo dõi các thị trường, điều này rất quan trọng: càng thường xuyên proxy bị chặn, thì càng nhiều lần thử lại và tỷ lệ tiêu thụ lưu lượng thực tế sẽ cao hơn so với công thức tính toán.

Loại proxy Tỷ lệ thành công trên WB/Ozon Khi nào sử dụng
Proxy trung tâm dữ liệu 40-60% (dễ bị chặn hàng loạt) Theo dõi tần suất thấp, chạy thử nghiệm, danh mục nhỏ
Proxy cư trú 85-95% Lựa chọn chính cho 10.000+ sản phẩm, theo dõi hàng ngày
Proxy di động 90-98% Theo dõi tần suất cao trong các lĩnh vực khó khăn, vượt qua bảo vệ mạnh mẽ

Proxy trung tâm dữ liệu có vẻ tiết kiệm chi phí cho mỗi GB, nhưng trên thực tế, đối với Wildberries và Ozon, tỷ lệ thành công của chúng giảm chỉ sau vài giờ thu thập dữ liệu tích cực — các thị trường xác định các dải IP của nhà cung cấp dịch vụ lưu trữ và chặn quyền truy cập hàng loạt. Kết quả là bạn trả tiền cho lưu lượng mà được tiêu tốn cho các lần thử lại, chứ không phải cho các yêu cầu thành công thực tế.

Proxy cư trú sử dụng các IP thực tế của người dùng tại nhà, vì vậy được thị trường coi như là một khách truy cập bình thường trên trang web. Để theo dõi ổn định 10.000 sản phẩm, đây là sự cân bằng tối ưu giữa giá cả và độ tin cậy. Proxy di động cung cấp tỷ lệ thành công cao hơn, nhưng thường đắt hơn — chúng nên được kết nối một cách chọn lọc, cho các danh mục có vấn đề nhất hoặc trong các thời điểm cao điểm của các chương trình khuyến mãi.

Ba kịch bản tính toán ngân sách

Hãy phân tích ba kịch bản điển hình cho việc theo dõi 10.000 sản phẩm, để cho thấy phương pháp thu thập và tần suất cập nhật ảnh hưởng đến tổng khối lượng lưu lượng như thế nào.

Kịch bản 1: Theo dõi tiết kiệm qua API

4 lần cập nhật mỗi ngày, thu thập qua API nội bộ của thị trường (JSON, ~40 KB cho mỗi phản hồi), proxy cư trú với tỷ lệ thành công 90%.

  • Các yêu cầu cơ bản: 1.200.000 mỗi tháng
  • Với 10% các lần thử lại: 1.320.000 yêu cầu
  • Lưu lượng: 1.320.000 × 40 KB ≈ 50,4 GB mỗi tháng

Kịch bản 2: Tải trung bình với việc thu thập các trang HTML

6 lần cập nhật mỗi ngày, thu thập các thẻ sản phẩm hoàn chỉnh (HTML, ~500 KB cho mỗi phản hồi) để nhận được không chỉ giá cả mà còn cả tồn kho, đánh giá, vị trí trong tìm kiếm.

  • Các yêu cầu cơ bản: 1.800.000 mỗi tháng
  • Với các lần thử lại (15%): 2.070.000 yêu cầu
  • Lưu lượng: 2.070.000 × 500 KB ≈ 987 GB mỗi tháng

Kịch bản 3: Theo dõi tần suất cao trong mùa cao điểm

Cập nhật hàng giờ (24 lần mỗi ngày) qua API, thêm vào việc thu thập các trang danh mục để theo dõi vị trí trong kết quả tìm kiếm, proxy di động cho các danh mục có vấn đề.

  • Các yêu cầu đến sản phẩm: 7.200.000 mỗi tháng (40 KB mỗi yêu cầu)
  • Các yêu cầu đến các trang danh mục: 300.000 mỗi tháng (800 KB mỗi yêu cầu)
  • Lưu lượng: (7.200.000 × 40 KB) + (300.000 × 800 KB) ≈ 274,7 + 228,9 ≈ 503,6 GB mỗi tháng

Sự khác biệt giữa các kịch bản cho thấy rõ ràng: phương pháp thu thập dữ liệu ảnh hưởng đến ngân sách mạnh mẽ hơn so với tần suất cập nhật. Việc chuyển từ thu thập HTML sang làm việc qua API có thể giảm tiêu thụ lưu lượng từ 10-20 lần với cùng khối lượng sản phẩm và cùng tần suất kiểm tra.

Cách giảm tiêu thụ lưu lượng mà không làm mất dữ liệu

Có một số mẹo thực tế giúp giữ ngân sách theo dõi trong tầm kiểm soát mà không làm mất tính chính xác của dữ liệu.

  1. Thu thập qua API, không phải HTML. Nếu thị trường cung cấp dữ liệu qua API nội bộ (điều này có thể xác định bằng cách phân tích các yêu cầu mạng trong trình duyệt khi mở thẻ sản phẩm), hãy sử dụng chính nó — trọng lượng phản hồi giảm từ 10-20 lần.
  2. Phân loại sản phẩm theo ưu tiên. Không phải tất cả 10.000 SKU đều quan trọng như nhau. Các sản phẩm chủ lực với cạnh tranh cao hãy theo dõi mỗi giờ, các sản phẩm còn lại — 1-2 lần mỗi ngày. Điều này giảm tổng khối lượng yêu cầu từ 40-60%.
  3. Lưu trữ dữ liệu tĩnh. Tên, mô tả, đặc điểm của sản phẩm thay đổi rất ít — chỉ cần thu thập một lần mỗi tuần. Chỉ cần cập nhật giá và tồn kho mỗi giờ.
  4. Cấu hình luân chuyển proxy hợp lý. Thay đổi IP quá thường xuyên cho mỗi yêu cầu làm tăng số lượng captcha và các lần thử lại. Luân chuyển mỗi 5-10 yêu cầu từ một IP thường mang lại sự cân bằng tốt hơn giữa tính ẩn danh và tỷ lệ thành công.
  5. Nén lưu lượng qua gzip. Đảm bảo rằng kịch bản hoặc dịch vụ thu thập dữ liệu của bạn gửi tiêu đề Accept-Encoding: gzip — điều này giảm trọng lượng của các phản hồi JSON từ 60-70%.

Những sai lầm thường gặp khi tính toán ngân sách

Khi lập kế hoạch ngân sách cho việc theo dõi 10.000 sản phẩm, các nhà bán hàng thường mắc phải những sai lầm giống nhau, dẫn đến việc tiêu tốn quá mức hoặc, ngược lại, thiếu lưu lượng trong giữa tháng.

  • Không tính đến các lần thử lại. Khi làm việc với proxy trung tâm dữ liệu, đến 40-50% yêu cầu có thể kết thúc bằng captcha hoặc bị chặn — tiêu thụ lưu lượng thực tế sẽ cao hơn 1,5-2 lần so với tính toán.
  • Theo dõi tất cả với cùng một tần suất. Nếu 10.000 sản phẩm được cập nhật hàng giờ "để đề phòng", ngân sách sẽ tăng lên nhiều lần mà không mang lại lợi ích thực sự cho doanh nghiệp.
  • Quên về tính mùa vụ. Trong thời gian giảm giá (11.11, "Ngày thứ Sáu đen tối", Tết Nguyên Đán) các đối thủ thay đổi giá thường xuyên hơn, và cùng với đó là số lượng yêu cầu thử lại của bạn tăng lên do bảo vệ mạnh mẽ hơn của các thị trường chống lại việc thu thập dữ liệu.
  • Tính toán lưu lượng chỉ theo công thức, không có dự trữ. Hợp lý khi dự trữ 20-30% lưu lượng vượt mức tính toán để phòng trường hợp thay đổi cấu trúc trang của thị trường hoặc tăng tạm thời captcha.

Danh sách kiểm tra trước khi bắt đầu theo dõi

  • Xác định tần suất cập nhật giá cho các nhóm sản phẩm khác nhau (VIP / thông thường / ưu tiên thấp)
  • Kiểm tra xem có thể thu thập qua API của thị trường thay vì các trang HTML không
  • Tính toán khối lượng lưu lượng cơ bản theo công thức "yêu cầu × trọng lượng phản hồi"
  • Thêm dự trữ 20-30% cho các lần thử lại và captcha
  • Chọn loại proxy phù hợp với nhiệm vụ: proxy cư trú cho khối lượng chính, proxy di động cho các danh mục có vấn đề
  • Cấu hình luân chuyển IP hợp lý (không cho mỗi yêu cầu, mà mỗi 5-10 yêu cầu)
  • Bật nén gzip trong các yêu cầu để giảm trọng lượng của các phản hồi
  • Dự trữ ngân sách bổ sung cho các thời điểm cao điểm của các chương trình khuyến mãi và giảm giá

Kết luận

Ngân sách cho việc theo dõi 10.000 sản phẩm mỗi tháng không phải là một con số cố định, mà là kết quả của các quyết định cụ thể: tần suất cập nhật giá, cách thu thập dữ liệu và loại proxy nào nên sử dụng. Tính toán chính xác lưu lượng theo công thức "số lượng yêu cầu × trọng lượng phản hồi" với dự trữ cho các lần thử lại cho phép hiểu trước chi phí thực tế của việc theo dõi và tránh những bất ngờ không mong muốn giữa tháng.

Để theo dõi ổn định trên Wildberries, Ozon và Avito với khối lượng trung bình và lớn, chúng tôi khuyên bạn nên bắt đầu với proxy cư trú — chúng cung cấp tỷ lệ thành công cao với chi phí lưu lượng hợp lý. Nếu một số danh mục sản phẩm gặp phải bảo vệ mạnh mẽ hơn của thị trường, hãy kết nối một cách chọn lọc proxy di động chỉ cho chúng, chứ không phải cho toàn bộ danh mục ngay lập tức — điều này sẽ giúp kiểm soát ngân sách mà không làm mất chất lượng dữ liệu.