Câu hỏi "bao nhiêu tiền để thu thập một triệu trang" gần như luôn nhận được câu trả lời vô ích: "phụ thuộc vào trang web". Phụ thuộc - nhưng không phải một cách huyền bí. Chi phí được phân chia thành bốn thành phần có thể đo lường, và bất kỳ thành phần nào trong số đó đều có thể được tính trước, trước khi hóa đơn cho lưu lượng truy cập đến. Dưới đây là phép toán làm việc: từ đâu mà có gigabyte, tại sao giá "theo GB" không nói gì về ngân sách của bạn, và những yếu tố nào thực sự cắt giảm ngân sách một cách đáng kể.
Chỉ số chính - không phải giá theo gigabyte, mà là giá cho một yêu cầu thành công
Các nhà cung cấp cạnh tranh với những con số trên bảng trưng bày: $1/GB, $3/GB, $0.30 cho mỗi nghìn yêu cầu. Những con số này không thể so sánh với nhau, cho đến khi bạn đưa chúng về cùng một đơn vị - chi phí cho một lần trích xuất dữ liệu thành công. Chính điều này mà các báo cáo thị trường nhấn mạnh: những con số thô "theo GB" và "theo 1000 yêu cầu" không thể so sánh mà không tính đến trọng lượng trang và tỷ lệ phản hồi thành công.
Công thức đủ để lập kế hoạch:
Ngân sách = (số trang mục tiêu ÷ tỷ lệ thành công) × trọng lượng trung bình của trang × giá theo GB + chi phí cố định
Ba biến trong phần đầu tiên và một trong phần thứ hai. Hãy phân tích từng cái.
Thành phần 1: một trang nặng bao nhiêu
Đây là biến số bị đánh giá thấp nhất. Sự chênh lệch ở đây không phải là phần trăm, mà là nhiều lần, và nó phụ thuộc vào cách bạn lấy trang:
- Yêu cầu HTTP thông thường không có render - 50–150 KB. Bạn chỉ nhận được tài liệu HTML.
- Render đầy đủ trong trình duyệt headless - 100–300 KB khi được cấu hình cẩn thận.
- Trình duyệt "như là", không có bộ lọc - 0,2–1 MB và hơn thế. Bạn phải trả tiền cho hình ảnh, phông chữ, script quảng cáo, phân tích và video player mà bạn không cần.
Sự khác biệt giữa điểm đầu tiên và điểm thứ ba - lên đến hai mươi lần trên cùng một trang. Đối với một triệu trang, đó là sự khác biệt giữa 50 GB và 1000 GB lưu lượng truy cập.
Thành phần 2: giá gigabyte theo loại proxy
Các khoảng giá thị trường hiện tại cho năm 2026 như sau:
- Data center - $0,50–3 cho mỗi GB hoặc phí hàng tháng cho IP.
- Residential - $1–8 cho mỗi GB. Định hướng chất lượng giá: khoảng $1/GB - đề nghị tuyệt vời, $3–4/GB - giữa thị trường, $5–8/GB - phân khúc doanh nghiệp.
- Di động (4G/5G) - $2–15 cho mỗi GB.
- ISP / residential tĩnh - $1,5–5 cho mỗi IP mỗi tháng.
- API scraping sẵn có - $0,30–12 cho 1000 yêu cầu.
Sự cám dỗ để chọn cái rẻ nhất là điều dễ hiểu, nhưng nó bị phá vỡ bởi thành phần tiếp theo.
Thành phần 3: tỷ lệ thành công - yếu tố ẩn trong ngân sách
Mỗi yêu cầu bị chặn bạn vẫn phải trả tiền: lưu lượng đã tiêu tốn, không có dữ liệu. Do đó, số yêu cầu thực tế bằng số mục tiêu chia cho tỷ lệ thành công, và yếu tố nhân tăng không tuyến tính:
- tỷ lệ thành công 95% - trả thêm 5%;
- tỷ lệ thành công 70% - bạn sẽ cần khoảng 400 nghìn yêu cầu nhiều hơn cho mỗi triệu mục tiêu;
- tỷ lệ thành công 60% - cần nhiều hơn 2,5 lần yêu cầu.
Đó là lý do tại sao một data center giá $0,50/GB trên một trang web bảo mật lại đắt hơn residential giá $3/GB: Cloudflare, DataDome và Akamai mặc định đánh dấu ASN của data center, và bạn phải trả tiền cho lưu lượng từ chối. Theo ước tính vào tháng 7 năm 2026, các proxy di động giữ tỷ lệ thành công 90–95% so với các hệ thống chống bot hiện đại - nơi mà data center không thể vượt qua.
Kết luận thực tiễn: loại proxy được chọn không phải theo giá, mà theo mục tiêu. Các danh mục đơn giản và API mở - data center. Cửa hàng, mạng xã hội, các trang tổng hợp có bảo vệ - residential. Các trang web có tính cạnh tranh cao và phiên bản di động của các trang web - di động.
Ba kịch bản cho một triệu trang
Hãy cùng tổng hợp các con số. Điều kiện giống nhau: một triệu trang hữu ích.
Kịch bản A - "kỷ luật". HTTP-client không có trình duyệt, 100 KB mỗi trang, residential giá $2/GB, tỷ lệ thành công 95%. Tổng cộng: 1,05 triệu yêu cầu × 100 KB ≈ 105 GB ≈ $210.
Kịch bản B - "điển hình". Trình duyệt headless với bộ lọc tài nguyên, 250 KB mỗi trang, residential giá $3/GB, tỷ lệ thành công 85%. Tổng cộng: 1,18 triệu × 250 KB ≈ 295 GB ≈ $885.
Kịch bản C - "không cấu hình". Trình duyệt tải tất cả mọi thứ, 800 KB mỗi trang, residential giá $5/GB, tỷ lệ thành công 65%. Tổng cộng: 1,54 triệu × 800 KB ≈ 1230 GB ≈ $6150.
Sự khác biệt giữa A và C - gần như gấp ba mươi lần, với cùng một kết quả đầu ra. Không có biến số nào là kỳ lạ: tất cả đều là các thiết lập mặc định thông thường so với sự cẩn thận thông thường. Để tham khảo: ước tính ngành cho một công ty vừa phải, xử lý một triệu yêu cầu mỗi tháng trên các trang web khác nhau, đưa ra $1000–3000 mỗi tháng - tức là giữa kịch bản B và C.
Những gì không bao gồm trong lưu lượng nhưng có trong hóa đơn
Proxy - thường là khoản chi lớn nhất, nhưng không phải là khoản duy nhất:
- Captcha. Giải quyết có giá $0,50–3 cho mỗi nghìn. Với 5% trang có captcha trên một triệu, đó là 50 nghìn giải pháp - $25–150. Chấp nhận được. Với 50% - đã là $250–1500, và câu hỏi không còn là kỹ thuật.
- Cơ sở hạ tầng. $20–200 mỗi tháng cho khối lượng nhỏ; $200–500 cho quy mô nhỏ và $3000–10 000 cho lưu lượng thực sự lớn.
- Lưu trữ và lưu lượng ra. Khoảng $0,023 cho mỗi GB mỗi tháng cho lưu trữ đối tượng và $0,09 cho mỗi GB ra tại các đám mây lớn - là một khoản nhỏ trên hàng trăm gigabyte, nhưng là một con số đáng kể trên hàng chục terabyte.
- Nhân lực. Dòng chi phí đắt nhất mà mọi người thường quên. Một trình thu thập dữ liệu sẵn sàng cho sản xuất - mất 8–12 tuần phát triển, sau đó 4–8 giờ mỗi tháng cho các trang web đơn giản và 20+ giờ cho các trang web bảo mật. Với mức giá $75/giờ, việc hỗ trợ nguồn bảo mật có giá $1500+ mỗi tháng - nhiều hơn toàn bộ lưu lượng trong kịch bản B.
Năm yếu tố thực sự cắt giảm ngân sách
- Loại bỏ trình duyệt ở những nơi không cần thiết. Nếu dữ liệu có trong HTML hoặc trong API nội bộ - render là thừa. Đây là yếu tố chính: giảm 60–80% lưu lượng.
- Chặn tài nguyên nếu trình duyệt là cần thiết. Hình ảnh, phông chữ, media, script quảng cáo và phân tích có thể bị tắt bằng một quy tắc chặn yêu cầu và mang lại tiết kiệm đáng kể. Phân tích chi tiết các phương pháp - trong tài liệu về tối ưu hóa chi phí lưu lượng qua proxy.
- Sắp xếp mục tiêu theo độ phức tạp. Chạy toàn bộ danh sách qua kênh đắt nhất - là sai lầm thường gặp nhất trong ngân sách. Phân loại các nguồn thành "mở", "bảo vệ vừa phải" và "cạnh tranh" và chỉ định loại proxy cho mỗi loại.
- Xây dựng chính sách retry một cách có ý thức. Lặp lại mù quáng ba lần cho một lần thất bại làm tăng gấp ba lưu lượng cho các mục tiêu gặp vấn đề. Chỉ nên lặp lại các mã phản hồi mà việc lặp lại có ý nghĩa, và với IP khác, không phải với cùng một IP.
- Cache và không lấy cùng một thứ hai lần. Danh sách, phân trang, các lần đi lại qua danh mục - ở đây dễ dàng mất hàng chục phần trăm ngân sách.
Khi nào API sẵn có rẻ hơn, và khi nào thì cần stack riêng
Cần tính toán tổng chi phí sở hữu, chứ không phải chỉ là dòng "theo GB". Các mốc thị trường: một trình thu thập dữ liệu riêng cho 100 nghìn trang mỗi tháng có giá từ $700–1650 bao gồm hỗ trợ, trong khi API sẵn có cho cùng một khối lượng - $50–300. Ở các con số lớn, bức tranh đảo ngược: 1 triệu yêu cầu mỗi tháng qua API có giá $250–2490, trong khi xây dựng cơ sở hạ tầng riêng cho 10 TB mỗi tháng được ước tính khoảng $230 nghìn mỗi năm so với $100–150 nghìn cho việc mua dịch vụ.
Quy tắc thô: khi khối lượng nhỏ và nhiều trang web - hãy chọn giải pháp sẵn có, bạn đang trả tiền cho sự hỗ trợ của người khác. Khi khối lượng ổn định, mục tiêu ít và đã được nghiên cứu kỹ - stack riêng trên proxy rẻ hơn, vì bạn không còn phải trả tiền cho việc render mà bạn không cần. So sánh chi tiết giữa hai phương pháp - trong phân tích proxy so với scraping API và web unblocker.
Điều gì sẽ thay đổi vào mùa thu năm 2026
Có một yếu tố sẽ đẩy các tính toán lên cao. Từ ngày 15 tháng 9 năm 2026, Cloudflare sẽ chuyển các miền mới sang chặn các danh mục Training và Agent theo mặc định - trên các trang có quảng cáo; thay đổi này ảnh hưởng đến khách hàng mới, các trang web mới của khách hàng hiện tại và tất cả khách hàng sử dụng gói miễn phí. Các crawler tìm kiếm vẫn được phép. Đồng thời, Pay Per Crawl sẽ chuyển thành Pay Per Use: nhà xuất bản sẽ nhận tiền không phải cho việc vượt qua trang, mà cho việc sử dụng nội dung trong phản hồi của AI.
Bối cảnh rất đơn giản: theo dữ liệu của Cloudflare, 52% yêu cầu của crawler trong mạng của họ hiện đang dành cho việc đào tạo AI so với 22% vào mùa xuân năm 2025. Mạng đang bị đóng lại, và ý nghĩa thực tiễn cho ngân sách như sau - tỷ lệ thành công trên các nguồn bảo mật sẽ giảm trung bình, và do đó yếu tố ẩn trong ngân sách từ thành phần thứ ba sẽ trở nên quan trọng hơn. Hãy tính toán điều này vào kế hoạch của bạn, thay vì chỉ biết qua hóa đơn.
Tóm lại
Chi phí thu thập dữ liệu không phải là giá theo gigabyte, mà là tích của trọng lượng trang, giá kênh và nghịch đảo của tỷ lệ thành công. Sự khác biệt giữa một pipeline cẩn thận và một pipeline cẩu thả trên một triệu trang không được đo bằng phần trăm, mà bằng bậc của độ lớn. Trước khi thương lượng giảm giá với nhà cung cấp, hãy tính toán xem bạn đang trả bao nhiêu cho việc tải hình ảnh mà bạn không thu thập, và cho những lần lặp lại không nên xảy ra. Thông thường, có nhiều tiền hơn ở đó so với bất kỳ khoản giảm giá nào.
```