Parser pada pemilih CSS rusak ketika situs mengubah tata letak. Parser pada LLM tidak rusak, tetapi mengenakan biaya untuk setiap halaman. Pada tahun 2026, pilihan antara keduanya tidak lagi menjadi masalah selera: harga model berbeda puluhan kali, dan halaman yang sama bisa berharga 3.000 atau 20.000 token tergantung pada apa yang Anda kirimkan ke model. Di bawah ini adalah perbandingan tiga pendekatan berdasarkan biaya, keandalan, dan lalu lintas proxy, dengan perhitungan untuk 1.000 dan satu juta halaman.
Singkatnya: apa yang dipilih
- Pemilih (CSS/XPath) — satu template halaman, volume besar, tata letak stabil. Biaya ekstraksi mendekati nol, tetapi dukungan menjadi tanggung jawab pengembang.
- Ekstraksi LLM — banyak situs berbeda, tata letak tidak stabil, tugas sekali jalan. Anda membayar untuk token di setiap halaman dan harus memvalidasi respons.
- Hibrida — LLM sekali menulis pemilih, selanjutnya pemilih berfungsi, dan model hanya dipanggil ketika pemeriksaan data gagal. Untuk sebagian besar parser tetap, ini adalah yang terbaik.
Kriteria perbandingan
Kami membandingkan berdasarkan lima poin yang benar-benar mempengaruhi total biaya dan kualitas data:
- biaya ekstraksi untuk 1.000 halaman;
- perilaku saat tata letak berubah;
- akurasi dan risiko nilai yang dibuat-buat;
- kecepatan dan latensi;
- penggunaan lalu lintas proxy — seperti yang akan Anda lihat, ini hampir tidak tergantung pada metode yang dipilih.
Berapa biaya ekstraksi LLM: menghitung berdasarkan harga pada Oktober 2026
Harga resmi untuk satu juta token (masuk / keluar) pada tarif standar:
- Gemini 2.5 Flash-Lite — $0,10 / $0,40;
- Gemini 3.1 Flash-Lite — $0,25 / $1,50;
- Claude Haiku 4.5 — $1 / $5;
- Gemini 3.5 Flash — $1,50 / $9.
Google dan Anthropic memiliki Batch API dengan diskon 50% untuk masuk dan keluar — untuk pemrosesan, di mana respons tidak diperlukan secara instan, ini adalah cara pertama untuk menghemat biaya.
Variabel utama — bukan model, tetapi apa yang Anda kirimkan ke dalamnya
Halaman HTML mentah saat dikirim ke model biasanya memerlukan 10–40 ribu token. Cloudflare, saat meluncurkan fungsi Markdown untuk Agen, memberikan contoh: satu dan sama catatan blog memiliki berat 16.180 token dalam HTML dan 3.150 token dalam Markdown — pengurangan 80%. Pengukuran lain pada berita, dokumentasi, dan kartu produk menunjukkan pengurangan dari 67 hingga 94%.
Untuk perhitungan, kita akan mengambil asumsi: halaman mentah — 20.000 token, dibersihkan menjadi Markdown — 3.000, ditambah 500 token untuk instruksi dan skema, pada keluaran 300 token JSON. Untuk 1.000 halaman kita mendapatkan:
| Model | HTML Mentah (20,5 juta masuk) | Markdown (3,5 juta masuk) |
|---|---|---|
| Gemini 2.5 Flash-Lite | ≈ $2,17 | ≈ $0,47 |
| Gemini 3.1 Flash-Lite | ≈ $5,58 | ≈ $1,33 |
| Claude Haiku 4.5 | ≈ $22,00 | ≈ $5,00 |
| Gemini 3.5 Flash | ≈ $33,45 | ≈ $7,95 |
Perbedaan — 70 kali antara pilihan terburuk dan terbaik dengan hasil yang sama. Dua pertiga dari perbedaan ini disebabkan oleh pembersihan input, bukan pemilihan model. Pada satu juta halaman per bulan, ini bisa sekitar $470, atau lebih dari $33.000.
Satu detail lagi: model Claude mulai dari versi 4.7 menggunakan tokenisasi baru, yang menurut data Anthropic, memberikan sekitar 30% lebih banyak token untuk teks yang sama. Saat membandingkan tagihan dari berbagai generasi model, pertimbangkan ini — Haiku 4.5 bekerja pada tokenisasi lama.
Pemilih: hampir gratis, sampai situs berubah
Pelaksanaan pemilih CSS atau XPath pada halaman yang sudah diunduh memerlukan sebagian kecil dari milidetik prosesor. Dalam panduan ScrapingBee, penilaian adalah sebagai berikut: pada tata letak yang stabil, pemilih biasa sekitar 10 kali lebih murah dan lebih cepat daripada ekstraksi LLM. Dalam praktiknya, perbedaannya bahkan lebih besar, karena pemilih tidak memerlukan permintaan jaringan ke API model.
Harga pemilih — dalam dukungan:
- situs mengganti nama kelas atau membungkus blok dalam div baru — parser diam-diam mengembalikan bidang kosong;
- uji A/B menunjukkan template yang berbeda kepada pengunjung yang berbeda, dan beberapa halaman tidak dapat diparsing;
- pada 50 situs berbeda, Anda mendukung 50 set pemilih.
Skenario paling berbahaya — bukan keruntuhan, tetapi kerusakan data yang diam-diam: pemilih menangkap elemen tetangga, dan basis data menulis harga lama selama berminggu-minggu alih-alih harga saat ini.
LLM: tahan terhadap tata letak, tetapi bisa membuat-buat
Model tidak memerlukan jalur yang tepat ke elemen — ia mencari "harga" berdasarkan makna. Ini mengatasi masalah kelas yang diganti nama dan berbagai template. Namun, muncul tiga jenis kesalahan yang dijelaskan oleh semua orang yang menjalankan parser semacam itu dalam produksi:
- nilai yang dibuat-buat — model "menebak" harga atau artikel yang tidak ada di halaman;
- bidang yang terlewat — sebagian data tidak diekstraksi;
- drift struktur — string alih-alih angka, nama kunci yang berbeda.
Perlindungan wajib: skema respons yang ketat, validasi (misalnya, Pydantic), temperature = 0 dan pengulangan saat terjadi kesalahan. Nol suhu mengurangi penyebaran, tetapi tidak menghilangkan halusinasi sepenuhnya. Untuk harga dan stok, masuk akal untuk menambahkan pemeriksaan "nilai benar-benar muncul dalam teks halaman".
Latensi juga lebih tinggi: waktu muat halaman melalui proxy ditambah respons model — dari sebagian detik hingga beberapa detik. Untuk pemantauan sekali sehari ini tidak penting, tetapi untuk melacak penurunan — sangat penting.
Hibrida: LLM menulis pemilih, bukan mengekstrak data
Jalan ketiga didukung langsung oleh perpustakaan populer. Di Crawl4AI ada fungsi untuk menghasilkan skema: model sekali melihat contoh HTML dan mengembalikan satu set pemilih CSS/XPath, setelah itu ekstraksi berjalan tanpa panggilan LLM. Dalam dokumentasi ditekankan bahwa ini adalah biaya sekali jalan, dan skema dapat digunakan kembali tanpa batasan; dengan beberapa contoh, model sering memilih pemilih yang lebih tahan terhadap atribut daripada posisi yang rapuh seperti nth-child.
Skema kerja hibrida:
- LLM menghasilkan pemilih berdasarkan 3–5 contoh halaman dari satu template.
- Parser bekerja pada pemilih, setiap catatan diperiksa oleh validator: bidang di tempat, tipe benar, harga dalam rentang yang wajar.
- Jika proporsi catatan tidak valid melebihi ambang batas (katakanlah, 2–5%), halaman pergi ke ekstraksi LLM, dan skema — untuk regenerasi.
- Skema baru diuji pada sampel kontrol dan hanya kemudian menggantikan yang lama.
Dengan cara ini, Anda membayar untuk model hanya pada saat perubahan tata letak, bukan untuk setiap dari satu juta halaman.
Tabel ringkasan
| Kriteria | Pemilih | Ekstraksi LLM | Hibrida |
|---|---|---|---|
| Biaya ekstraksi | sekitar nol | $0,5–33 untuk 1.000 halaman. | sekitar nol + panggilan sekali jalan |
| Perubahan tata letak | rusak, sering diam-diam | biasanya bertahan | memperbaiki secara otomatis |
| Risiko data yang dibuat-buat | tidak ada (tetapi ada "bukan elemen itu") | ada, perlu validasi | minimal |
| Kecepatan | maksimal | + respons model di setiap halaman | seperti pemilih |
| Banyak situs berbeda | mahal dalam dukungan | kekuatan utama | baik, skema untuk setiap template |
| Lalu lintas proxy | sama — model tidak mengurangi byte yang diunduh | ||
Tentang proxy: LLM tidak menghemat lalu lintas
Kesalahan umum dalam perhitungan — menganggap bahwa parser "cerdas" lebih murah di jaringan. Tidak: konversi HTML ke Markdown terjadi setelah pengunduhan, sehingga halaman lengkap melewati proxy dengan metode ekstraksi apa pun. Pengecualian — situs di mana pemiliknya sendiri mengaktifkan pengiriman Markdown melalui header Accept: text/markdown (seperti dalam fungsi Cloudflare), tetapi ini adalah keputusan situs, bukan keputusan Anda.
Untuk skala: dengan berat HTML 200 KB tanpa gambar, 1.000 halaman — sekitar 0,2 GB, atau sekitar $0,54 untuk proxy residensial dengan biaya $2,70 per GB. Bandingkan dengan tabel di atas: saat mengirim HTML mentah ke Claude Haiku 4.5, tagihan untuk model akan 40 kali lebih besar daripada tagihan untuk proxy, sedangkan untuk Markdown dan Flash-Lite mereka sebanding. Jika Anda merender halaman dengan browser headless, lalu lintas akan meningkat berkali-kali — pengukuran ada dalam perbandingan kami penggunaan lalu lintas Playwright, Puppeteer, dan requests untuk 1.000 halaman.
Apa yang benar-benar mempengaruhi lalu lintas dengan metode apa pun:
- tidak mengunduh gambar, font, dan analitik jika tidak diperlukan;
- mencari API JSON internal daripada HTML;
- tidak melakukan pengulangan yang tidak perlu: setiap larangan dan percobaan ulang — itu adalah byte yang dibayar. Lebih lanjut tentang mengapa biaya per GB menipu — dalam analisis biaya nyata dari catatan yang berhasil.
Untuk katalog sederhana tanpa perlindungan anti-bot yang ketat, cukup menggunakan proxy data center dengan biaya $1,50 per GB; proxy residensial diperlukan di tempat di mana IP hosting dibatasi di pintu masuk.
Rekomendasi untuk skenario
- Memantau harga satu hingga tiga marketplace, ratusan ribu kartu produk. Hibrida atau pemilih murni dengan validator. LLM hanya dihubungkan untuk regenerasi skema.
- Pengumpulan data dari ratusan situs yang berbeda (leads, lowongan, kontak). Ekstraksi LLM dalam Markdown melalui model murah dalam mode batch. Tanpa skema ketat dan validasi, jangan jalankan.
- Penelitian sekali jalan pada beberapa ribu halaman. LLM: dengan biaya beberapa dolar, Anda menghemat hari dalam menulis pemilih.
- Data di mana kesalahan berharga (harga untuk penetapan ulang harga, stok). Pemilih atau hibrida ditambah pemeriksaan nilai dengan teks asli halaman.
- RAG dan basis pengetahuan. Di sini yang dibutuhkan bukanlah struktur, tetapi teks murni: konversi ke Markdown tanpa ekstraksi bidang, model — hanya pada tahap respons.
Kesimpulan
Ekstraksi LLM tidak menggantikan pemilih, tetapi menggeser titik pemilihan. Yang paling murah adalah hibrida: model menulis dan memperbaiki pemilih, bukan membaca setiap halaman. Jika tidak mungkin untuk tidak menggunakan model di setiap halaman, pertama bersihkan input menjadi Markdown dan gunakan batch: dua langkah ini mengurangi tagihan 5–10 kali sebelum Anda mulai memilih model. Dan ingat, lalu lintas proxy tidak tergantung pada metode ekstraksi: Anda perlu menghematnya pada apa yang Anda unduh, bukan pada bagaimana Anda menganalisisnya.
