Kembali ke blog

Harga proxy dalam $/GB menipu: hitung biaya pendaftaran yang sukses

Giga murah sering kali lebih mahal daripada yang mahal. Kami membahas tiga pengali antara harga dan tagihan, mengeluarkan rumus biaya seribu catatan yang berhasil diekstrak dan menghitung dengan harga nyata tahun 2026, ketika $2/GB kalah dari $6/GB.

📅23 Agustus 2026
Harga proxy dalam $/GB menipu: hitung biaya pendaftaran yang sukses
```html

Daftar harga penyedia proxy disusun sedemikian rupa sehingga membandingkan penyedia tampak sebagai hal yang sederhana: satu gigabyte seharga $1, yang lain $8 — hitung, perbedaannya delapan kali lipat. Dalam praktiknya, tim yang membeli satu gigabyte seharga satu dolar secara teratur membayar lebih untuk data yang dikumpulkan dibandingkan dengan tim yang membayar delapan. Alasannya bukan pada pemasaran dan bukan pada biaya tersembunyi: harga per gigabyte hanya bukan satuan yang digunakan untuk mengukur tugas Anda. Anda tidak membeli lalu lintas — Anda membeli catatan yang berhasil diekstraksi, dan antara dua besaran ini terdapat rangkaian faktor pengali yang berbeda untuk setiap proyek.

Tagihan datang bukan untuk apa yang Anda hitung

Scene yang khas: merencanakan untuk mengumpulkan satu juta kartu produk, menganggarkan 200 KB per halaman, mendapatkan 200 GB yang dihitung dan anggaran sekitar seribu lima ratus dolar. Setelah sebulan di akun pribadi — 900 GB dan tagihan tiga kali lebih besar dari anggaran. Tidak ada yang menipu: tiga hal telah berubah yang tidak ada dalam perhitungan.

Perbedaan antara harga dan tagihan selalu terurai menjadi komponen yang sama. Penting untuk membedahnya satu per satu — selanjutnya rumusnya akan terbentuk dengan sendirinya.

Tiga faktor pengali antara harga dan tagihan

1. Berapa sebenarnya berat halaman

Estimasi "200 KB" diambil dari kepala dan merujuk pada HTML mentah. Berat sebenarnya tergantung pada bagaimana Anda mengambil halaman tersebut. Respons HTML mentah dari toko modern biasanya ratusan kilobyte. Namun, halaman yang sepenuhnya dirender di browser headless dengan semua skrip, font, gambar, dan analitik sudah memiliki berat 2–5 MB. Perbedaan antara dua cara untuk mendapatkan data yang sama — adalah urutan besar, dan itu sepenuhnya mempengaruhi lalu lintas Anda.

Perhitungan industri biasanya menggunakan kisaran 1–3 MB untuk pengumpulan yang tidak dioptimalkan dan 100–300 KB untuk yang dioptimalkan. Antara kedua mode ini — bukan "sedikit penghematan", tetapi perbedaan sepuluh kali lipat pada proyek yang sama.

2. Berapa banyak respons yang benar-benar berguna

Faktor pengali kedua — tingkat keberhasilan, proporsi permintaan yang mengembalikan konten yang berguna. CAPTCHA alih-alih halaman, 403, kerangka kosong tanpa data, pengalihan ke halaman dummy — semua ini adalah lalu lintas berbayar yang tidak memberikan satu pun catatan.

Matematika sederhana dan tanpa ampun: jumlah permintaan = catatan yang diperlukan ÷ tingkat keberhasilan. Dengan 95% keberhasilan, satu juta catatan membutuhkan 1,05 juta permintaan. Dengan 70% — sudah 1,43 juta. Dengan 60% — 1,67 juta. Jadi, penurunan keberhasilan dari 95% menjadi 60% sendiri menambah tagihan hampir 60%, dengan harga gigabyte yang sama.

3. Retry, timeout, dan lalu lintas tambahan

Di atas itu, ada lalu lintas tambahan dari lapisan itu sendiri. Di sini, perbedaan antara tumpukan yang matang dan yang dibangun dengan terburu-buru sangat besar: pada platform terkelola yang teruji, pengiriman ulang memakan sekitar 0,1–3% tambahan, pada pipeline Scrapy yang ditulis sendiri — 5–15%, dan proporsinya meningkat seiring dengan skala. Logika retry yang agresif, yang menyerang domain yang diblokir lima kali berturut-turut, dengan mudah mengubah persentase ini menjadi puluhan.

Metrik yang tidak berbohong

Kita kumpulkan semuanya dalam satu besaran. Yang perlu dihitung bukanlah dolar per gigabyte, tetapi biaya seribu catatan yang berhasil diekstraksi:

  • Harga per 1000 catatan = (rata-rata berat respons dalam GB ÷ tingkat keberhasilan) × (1 + proporsi retry) × harga per GB × 1000

Nilai dari rumus ini adalah bahwa ia membuat tawaran yang tidak sebanding menjadi sebanding. Kolam murah dengan tingkat pemblokiran 40% dan yang mahal dengan tingkat pemblokiran 5% akhirnya berada pada sumbu yang sama. Menariknya, metrik ini juga diadopsi oleh penyedia selama setahun terakhir: dalam materi industri, semakin sering terdengar frasa "harga dibagi dengan tingkat keberhasilan", bukan harga mentah per gigabyte.

Bagaimana ini terlihat dalam uang

Mari kita ambil satu juta catatan, halaman rata-rata 500 KB dan lalu lintas residensial seharga $8/GB — tengah pasar yang khas. Kita hanya mengubah keberhasilan:

  • 95% keberhasilan — 1,05 juta permintaan, sekitar 525 GB, sekitar $4.200
  • 70% keberhasilan — 1,43 juta permintaan, sekitar 715 GB, sekitar $5.720
  • 60% keberhasilan — 1,67 juta permintaan, sekitar 835 GB, sekitar $6.680

Perbedaannya — hampir $2.500 pada harga yang sama. Sekarang mari kita bandingkan dua tawaran yang dalam daftar harga terlihat seperti langit dan bumi. Penyedia A: $2/GB, tetapi pada tujuan Anda memiliki 55% keberhasilan. Penyedia B: $6/GB dan 92% keberhasilan. Dengan 500 KB dan satu juta catatan, A menghasilkan sekitar 910 GB dan $1.820, sedangkan B — sekitar 545 GB dan $3.270. Di sini A memang lebih murah, dan ini adalah hasil yang jujur: dengan perbedaan harga yang besar, keberhasilan yang rendah tidak selalu mengurangi keuntungan.

Tetapi tambahkan retry 15% untuk A dibandingkan 3% untuk B, tambahkan rendering headless, yang diaktifkan karena kolam murah lebih sering memberikan halaman dummy alih-alih konten — dan berat halaman untuk A menjadi 1,5 MB dibandingkan 500 KB untuk B. Perhitungan ulang: A — sekitar 3,1 TB dan $6.200, B — sekitar 560 GB dan $3.370. Posisi telah terbalik. Itulah mengapa pertanyaan "siapa yang lebih murah per gigabyte" tidak memiliki makna tersendiri: jawabannya tergantung pada tujuan Anda, tumpukan Anda, dan tingkat pemblokiran Anda.

Mengapa API scraping dihitung berbeda — dan bagaimana membandingkannya

Satu kesulitan tambahan adalah bahwa sebagian pasar tidak menjual gigabyte sama sekali. API scraping dan penghapus web mengenakan biaya per permintaan, dan mereka menagih berdasarkan kompleksitas. Kisaran harga tahun 2026 untuk 1000 halaman terlihat seperti ini:

  • HTML sederhana: ScrapeOps sekitar $0,19, ScraperAPI sekitar $0,49, Scrape.do sekitar $0,58, ScrapingBee sekitar $0,66, Bright Data sekitar $1,00
  • Dengan rendering JS (biasanya 5 kredit alih-alih satu): ScrapeOps sekitar $0,95, Scrape.do sekitar $2,90, ScrapingBee sekitar $3,30, ScraperAPI sekitar $4,90, Bright Data sekitar $5,00
  • Situs di bawah perlindungan anti-bot (10–25 kredit): ScrapeOps sekitar $1,90, Scrape.do sekitar $4,45, ScraperAPI sekitar $5,96, ScrapingBee sekitar $6,60, Bright Data dalam kisaran $8–15

Perhatikan perbedaan di dalam satu penyedia: halaman sederhana dan halaman yang dilindungi oleh ScraperAPI berbeda dua belas kali lipat. Tarif "per permintaan" terlihat lebih dapat diprediksi dibandingkan gigabyte hingga saat tujuan berpindah dari kategori pertama ke ketiga — dan ini terjadi tanpa partisipasi Anda, berdasarkan keputusan pemilik situs.

Ini diringkas ke dalam sumbu umum dengan rumus yang sama: biaya permintaan ÷ tingkat keberhasilan × 1000. Setelah itu, tawaran "$3,30 untuk 1000 halaman JS" dan tawaran "$6 per gigabyte lalu lintas residensial" akhirnya bisa diletakkan berdampingan. Analisis yang lebih luas tentang pendekatan itu sendiri — API resmi, dataset siap pakai, atau parser Anda sendiri — telah kami bahas secara terpisah; di sini yang penting hanyalah perbandingan mereka dalam hal uang.

Pengukuran dalam satu malam

Rumus ini tidak berguna tanpa angka Anda sendiri, dan kabar baiknya adalah bahwa mendapatkan angka tersebut — pekerjaan yang memakan waktu beberapa jam. Pilot pada 1000 permintaan menggunakan URL Anda yang sebenarnya memberikan semua yang diperlukan.

  1. Ambil sampel tujuan yang representatif — bukan halaman utama, tetapi kartu, kategori, dan hasil yang akan Anda kumpulkan di produksi. Keberhasilan di halaman utama tidak memprediksi apa pun.
  2. Catat secara terpisah empat penghitung: respons valid dengan data, kesalahan HTTP, CAPTCHA dan tantangan, "dua ratus kosong" — kode 200 tanpa konten yang diperlukan. Kategori terakhir adalah yang paling licik: secara formal ini adalah keberhasilan, tetapi secara faktual — sampah yang dibayar.
  3. Ambil volume lalu lintas yang sebenarnya dari statistik penyedia, bukan dari perkiraan Anda. Perbedaan antara berat halaman yang dihitung dan yang sebenarnya — biasanya temuan pertama dari pilot semacam itu.
  4. Hitung retry sebagai baris terpisah, dan jangan larutkan mereka dalam jumlah permintaan secara keseluruhan.
  5. Ulangi pada penyedia kedua di hari yang sama. Keberhasilan berfluktuasi bersama dengan suasana sistem anti-bot, dan pengukuran yang terpisah selama seminggu tidak dapat dibandingkan.

Jika pilot menunjukkan keberhasilan yang rendah, jangan terburu-buru mengganti penyedia: pertama-tama, pahami alasannya. Analisis sumber masalah yang umum telah dikumpulkan dalam materi tentang cara mendiagnosis tingkat keberhasilan rendah pada proxy, dan kontrol rutin terhadap metrik yang sama harus dijadikan kebiasaan. Seringkali masalah terletak pada header, timing, atau jejak TLS klien, dan bukan pada kualitas IP.

Empat pengungkit yang menggerakkan angka lebih kuat daripada diskon

Ketika metrik dihitung, terlihat di mana ia paling sensitif. Diskon 10% pada harga adalah pengungkit terlemah yang tersedia.

Berat respons. Keuntungan tercepat. Mengambil hanya apa yang diperlukan mengurangi lalu lintas 2–10 kali lipat. Jika browser headless wajib, blokir pada tingkat intersepsi permintaan gambar, font, media, dan skrip pihak ketiga — konten tidak akan terpengaruh, tetapi volume akan turun secara signifikan. Aktifkan kompresi dan permintaan bersyarat berdasarkan ETag: halaman yang tidak berubah sejak pemindaian terakhir harus dikenakan biaya respons 304, bukan megabyte.

Keberhasilan. Setiap sepuluh poin persentase keberhasilan dalam kisaran 60–95% — itu adalah puluhan persen dari tagihan. Di sini yang berfungsi bukan uang, tetapi rekayasa: jejak klien yang benar, kecepatan yang masuk akal, jenis IP yang tepat untuk tujuan tertentu.

Campuran jenis proxy. Mengalirkan seluruh lalu lintas melalui kolam residensial — kesalahan yang paling umum dan paling mahal. Sebagian besar tujuan dapat dengan baik ditangani oleh proxy data center, yang lebih murah sepuluh kali lipat; alamat residensial hanya masuk akal untuk dibelanjakan pada apa yang benar-benar membutuhkannya. Pengarahan berdasarkan tujuan, bukan kebiasaan, memangkas pengeluaran proxy hingga 60–70%.

Disiplin retry. Penundaan eksponensial, batas percobaan, menolak pengulangan pada kode yang tidak dapat diperbaiki dengan pengulangan. Perbedaan antara 3% dan 15% lalu lintas tambahan — adalah perbedaan antara lapisan yang rapi dan tidak adanya lapisan tersebut. Aspek praktis dari masalah ini telah dibahas dalam materi tentang optimasi pengeluaran lalu lintas melalui proxy.

Apa yang tetap di luar lalu lintas

Gambaran lengkap tentang pengeluaran lebih luas daripada tagihan proxy, dan ini harus diingat saat memilih antara "mengumpulkan sendiri" dan "membeli yang sudah jadi". Untuk proyek berskala satu juta halaman per bulan, perkiraan industri untuk solusi self-hosted terlihat seperti ini: lalu lintas residensial $500–1500, waktu rekayasa $1000–2000, infrastruktur $300–500. Total $2000–4400 per bulan — dan ini sebelum menulis logika bisnis itu sendiri. Dengan tarif insinyur sekitar $100 per jam, beberapa hari yang dihabiskan untuk memperbaiki pemilih yang rusak lebih mahal daripada tagihan bulanan untuk proxy.

Ini bukan argumen melawan pengumpulan mandiri — ini adalah argumen untuk menghitung jam rekayasa sebagai baris anggaran yang sama seperti gigabyte. Model penetapan tarif juga harus dipilih dengan bijak: untuk sesi panjang yang stabil, pembayaran untuk IP khusus sering kali lebih menguntungkan daripada per megabyte.

Singkatnya

Harga per gigabyte bukanlah harga data, tetapi harga dari salah satu dari empat faktor pengali. Membandingkan penyedia berdasarkan itu — sama saja dengan memilih mobil berdasarkan harga liter bensin, tanpa menanyakan tentang konsumsi. Satuan kerja perbandingan yang satu: berapa biaya seribu catatan yang berhasil diekstraksi pada tujuan Anda, dengan berat respons Anda, keberhasilan Anda, dan retry Anda.

Hitung itu pada pilot dengan seribu permintaan, sebelum mendaftar untuk tarif tahunan. Seringkali terungkap bahwa tawaran termurah dalam daftar harga justru lebih mahal daripada semua yang lain — dan bahwa cadangan terbesar untuk penghematan tidak terletak pada negosiasi diskon, tetapi pada dua puluh baris kode yang mematikan pemuatan gambar.

```