Pertanyaan "berapa biaya untuk meng-crawl satu juta halaman" hampir selalu mendapatkan jawaban yang tidak berguna: "tergantung pada situsnya". Tergantung โ tetapi tidak secara mistis. Biaya terbagi menjadi empat komponen yang terukur, dan masing-masing dapat dihitung sebelumnya, sebelum tagihan untuk lalu lintas datang setelahnya. Di bawah ini adalah aritmatika yang bekerja: dari mana gigabyte berasal, mengapa harga "per GB" tidak memberi tahu apa pun tentang anggaran Anda, dan alat apa yang benar-benar dapat memangkas anggaran secara signifikan.
Metrik utama โ bukan harga per gigabyte, tetapi harga per permintaan yang berhasil
Penyedia bersaing dalam angka di etalase: $1/GB, $3/GB, $0,30 per seribu permintaan. Angka-angka ini tidak dapat dibandingkan satu sama lain, sampai Anda mengubahnya menjadi satu ukuran โ biaya satu pengambilan data yang berhasil. Inilah yang ditekankan oleh ulasan pasar: angka mentah "per GB" dan "per 1000 permintaan" tidak dapat dibandingkan tanpa mempertimbangkan berat halaman dan proporsi respons yang berhasil.
Rumus yang cukup untuk perencanaan:
Anggaran = (jumlah halaman target รท proporsi keberhasilan) ร rata-rata berat halaman ร harga per GB + biaya tetap
Tiga variabel di bagian pertama dan satu di bagian kedua. Mari kita bahas masing-masing.
Komponen 1: berapa berat satu halaman
Ini adalah variabel yang paling diremehkan. Variasi di sini โ bukan persentase, tetapi kali lipat, dan tergantung pada bagaimana Anda mengambil halaman:
- Permintaan HTTP biasa tanpa rendering โ 50โ150 KB. Anda hanya mendapatkan dokumen HTML.
- Rendering penuh di browser headless โ 100โ300 KB dengan pengaturan yang hati-hati.
- Browser "apa adanya", tanpa filter โ 0,2โ1 MB dan lebih. Anda membayar untuk gambar, font, skrip iklan, analitik, dan pemutar video yang tidak Anda butuhkan.
Perbedaan antara poin pertama dan ketiga โ hingga dua puluh kali lipat pada halaman yang sama. Untuk satu juta halaman, ini adalah perbedaan antara 50 GB dan 1000 GB lalu lintas.
Komponen 2: harga gigabyte berdasarkan jenis proxy
Koridor pasar yang relevan untuk tahun 2026 terlihat seperti ini:
- Data center โ $0,50โ3 per GB atau biaya bulanan untuk IP.
- Residential โ $1โ8 per GB. Acuan kualitas harga: sekitar $1/GB โ penawaran yang sangat baik, $3โ4/GB โ tengah pasar, $5โ8/GB โ segmen korporat.
- Mobile (4G/5G) โ $2โ15 per GB.
- ISP / residential statis โ $1,5โ5 per IP per bulan.
- API scraping siap pakai โ $0,30โ12 per 1000 permintaan.
Godaan untuk mengambil yang paling murah dapat dimengerti, tetapi itu terhalang oleh komponen berikutnya.
Komponen 3: proporsi keberhasilan โ pengganda anggaran yang tersembunyi
Setiap permintaan yang diblokir tetap Anda bayar: lalu lintas terbuang, data tidak ada. Oleh karena itu, jumlah permintaan yang sebenarnya sama dengan target, dibagi dengan proporsi keberhasilan, dan pengganda meningkat secara non-linear:
- keberhasilan 95% โ overpay 5%;
- keberhasilan 70% โ Anda akan membutuhkan sekitar 400 ribu permintaan lebih banyak untuk setiap satu juta catatan target;
- keberhasilan 60% โ permintaan yang dibutuhkan 2,5 kali lebih banyak.
Inilah sebabnya mengapa data center murah seharga $0,50/GB di situs yang dilindungi menjadi lebih mahal daripada residential seharga $3/GB: Cloudflare, DataDome, dan Akamai secara default menandai ASN data center, dan Anda membayar untuk aliran penolakan. Menurut perkiraan Juli 2026, proxy mobile mempertahankan 90โ95% keberhasilan terhadap sistem anti-bot modern โ di mana data center tidak dapat lolos sama sekali.
Kesimpulan praktis: jenis proxy dipilih bukan berdasarkan harga, tetapi berdasarkan tujuan. Katalog sederhana dan API terbuka โ data center. Toko, media sosial, agregator dengan perlindungan โ residential. Situs yang paling agresif dan versi mobile dari situs โ mobile.
Tiga skenario untuk satu juta halaman
Ayo kita kumpulkan angka-angka bersama. Syaratnya sama: satu juta halaman berguna.
Skenario A โ "disiplin". Klien HTTP tanpa browser, 100 KB per halaman, residential seharga $2/GB, keberhasilan 95%. Total: 1,05 juta permintaan ร 100 KB โ 105 GB โ $210.
Skenario B โ "tipikal". Browser headless dengan penyaringan sumber daya, 250 KB per halaman, residential seharga $3/GB, keberhasilan 85%. Total: 1,18 juta ร 250 KB โ 295 GB โ $885.
Skenario C โ "tanpa pengaturan". Browser memuat semuanya, 800 KB per halaman, residential seharga $5/GB, keberhasilan 65%. Total: 1,54 juta ร 800 KB โ 1230 GB โ $6150.
Perbedaan antara A dan C โ hampir tiga puluh kali lipat, dengan hasil yang sama di akhir. Tidak ada variabel yang eksotis: semua ini adalah pengaturan default biasa versus ketelitian biasa. Sebagai acuan: perkiraan industri untuk perusahaan ukuran menengah yang memproses satu juta permintaan per bulan di berbagai situs memberikan $1000โ3000 per bulan โ yaitu antara skenario B dan C.
Apa yang tidak termasuk dalam lalu lintas, tetapi termasuk dalam tagihan
Proxy โ biasanya merupakan artikel terbesar, tetapi bukan satu-satunya:
- Captcha. Penyelesaiannya berkisar antara $0,50โ3 per seribu. Dengan 5% halaman memiliki captcha di satu juta, itu 50 ribu penyelesaian โ $25โ150. Masih bisa ditoleransi. Dengan 50% โ sudah $250โ1500, dan pertanyaannya tidak lagi bersifat teknis.
- Infrastruktur. $20โ200 per bulan untuk volume kecil; $200โ500 untuk skala kecil dan $3000โ10.000 untuk aliran yang benar-benar besar.
- Penyimpanan dan lalu lintas keluar. Sekitar $0,023 per GB per bulan untuk penyimpanan objek dan $0,09 per GB untuk keluar di cloud besar โ kecil pada ratusan gigabyte, tetapi jumlah yang signifikan pada puluhan terabyte.
- Orang. Baris yang paling mahal, yang sering dilupakan. Parser siap produksi โ ini memerlukan 8โ12 minggu pengembangan, kemudian 4โ8 jam per bulan untuk situs sederhana dan 20+ jam untuk yang dilindungi. Dengan tarif $75/jam, dukungan untuk sumber yang dilindungi akan menelan biaya $1500+ per bulan โ lebih dari seluruh lalu lintas dalam skenario B.
Lima alat yang benar-benar memangkas anggaran
- Hapus browser di tempat yang tidak diperlukan. Jika data ada di HTML atau di API internal โ rendering tidak perlu. Ini adalah alat utama: mengurangi 60โ80% lalu lintas.
- Blokir sumber daya jika browser diperlukan. Gambar, font, media, skrip iklan dan analitik dapat dimatikan dengan satu aturan intersepsi permintaan dan memberikan penghematan yang signifikan. Analisis rinci tentang teknik ini โ dalam materi tentang optimisasi pengeluaran lalu lintas melalui proxy.
- Urutkan tujuan berdasarkan kesulitan. Mengirim seluruh daftar melalui saluran termahal โ adalah kesalahan anggaran yang paling umum. Kategorikan sumber menjadi "terbuka", "sedang terlindungi", dan "agresif" dan tetapkan jenis proxy yang sesuai untuk masing-masing.
- Bangun kebijakan retry dengan bijak. Mengulangi tiga kali pada kegagalan menggandakan lalu lintas pada tujuan yang bermasalah. Hanya ulangi kode respons di mana pengulangan masuk akal, dan dengan IP yang berbeda, bukan yang sama.
- Cache dan jangan ambil yang sama dua kali. Daftar, paginasi, dan pengulangan melalui katalog โ di sini mudah kehilangan puluhan persen anggaran.
Kapan lebih murah menggunakan API siap pakai, dan kapan menggunakan tumpukan sendiri
Anda harus menghitung total biaya kepemilikan, bukan hanya baris "per GB". Acuan pasar: parser sendiri untuk 100 ribu halaman per bulan menghabiskan $700โ1650 termasuk dukungan, sementara API siap pakai untuk volume yang sama โ $50โ300. Pada angka besar, gambaran berubah: 1 juta permintaan per bulan melalui API berharga $250โ2490, sementara membangun infrastruktur sendiri untuk 10 TB per bulan diperkirakan sekitar $230 ribu per tahun dibandingkan dengan $100โ150 ribu untuk membeli layanan.
Aturan kasar: selama volume kecil dan banyak situs โ ambil solusi siap pakai, Anda membayar untuk dukungan orang lain. Ketika volume stabil, tujuan sedikit dan sudah dipahami dengan baik โ tumpukan sendiri pada proxy lebih murah, karena Anda berhenti membayar markup untuk rendering yang tidak Anda butuhkan. Perbandingan mendalam antara kedua pendekatan โ dalam analisis proxy versus scraping API dan web unblocker.
Apa yang berubah pada musim gugur 2026
Ada faktor yang akan menggeser perhitungan ke atas. Mulai 15 September 2026, Cloudflare akan secara default memindahkan domain baru ke pemblokiran kategori Training dan Agent โ di halaman dengan iklan; perubahan ini akan mempengaruhi klien baru, situs baru dari klien yang ada, dan semua klien tarif gratis. Crawlers pencarian tetap diperbolehkan. Secara bersamaan, Pay Per Crawl berubah menjadi Pay Per Use: penerbit mendapatkan uang tidak untuk fakta melewati halaman, tetapi untuk penggunaan konten dalam respons AI.
Konteksnya sederhana: menurut data Cloudflare, 52% permintaan crawler di jaringan mereka sekarang berasal dari pelatihan AI dibandingkan dengan 22% pada musim semi 2025. Jaringan semakin tertutup, dan makna praktis untuk anggaran adalah โ proporsi keberhasilan pada sumber yang dilindungi rata-rata akan menurun, yang berarti pengganda anggaran tersembunyi dari komponen ketiga akan menjadi lebih signifikan. Rencanakan ini, jangan hanya menunggu tagihan.
Singkatnya
Biaya parsing bukanlah harga gigabyte, tetapi hasil dari berat halaman, harga saluran, dan kebalikan dari proporsi keberhasilan. Perbedaan antara pipeline yang hati-hati dan yang ceroboh pada satu juta halaman diukur bukan dalam persentase, tetapi dalam urutan besar. Sebelum menawar diskon dari penyedia, hitung berapa banyak yang Anda bayar untuk memuat gambar yang tidak Anda parsing, dan untuk pengulangan yang seharusnya tidak terjadi. Biasanya, lebih banyak uang terletak di sana daripada dalam diskon apa pun.
```