Kembali ke blog

Anda Tidak Diblokir — Anda Diberi Sampah: Tarpit dan Halaman Beracun di 2026

HTTP 200 tidak lagi berarti "data dikumpulkan". Nepenthes, Iocaine, dan Cloudflare AI Labyrinth memberi makan perayap dengan teks yang dihasilkan tanpa henti, sementara halaman yang terinfeksi membuat agen AI merekomendasikan merek yang tidak ada dalam 27–73,8% kasus. Mari kita bahas tiga mekanisme kerusakan data yang diam-diam dan tujuh pemeriksaan yang menangkap sampah sebelum dicatat ke dalam basis data.

📅13 September 2026
Anda Tidak Diblokir — Anda Diberi Sampah: Tarpit dan Halaman Beracun di 2026

Parser berfungsi. HTTP 200 mengalir deras, proxy hidup, captcha tidak muncul, antrean tautan terus bertambah. Namun, setelah seminggu, terungkap bahwa setengah dari harga yang dikumpulkan adalah fiksi, dan gigabyte lalu lintas telah terbuang pada halaman yang tidak ada di situs nyata. Ini bukan kerusakan parser dan bukan kumpulan IP yang buruk. Ini adalah mode perlindungan baru: situs tidak memblokir Anda, situs memberi Anda umpan.

Selama satu setengah tahun, industri perlindungan anti-bot secara diam-diam mengubah tujuannya. Pemblokiran adalah langkah yang mahal dan mencolok: scraper melihat 403, memperbaiki jejak, mengganti subnet, dan kembali. Jauh lebih menguntungkan untuk tidak mengganggu kerjanya, tetapi membuat pekerjaannya menjadi tidak berarti. Di bawah ini adalah tiga mekanisme yang sudah berfungsi di banyak situs, dan serangkaian pemeriksaan yang menangkap mereka di sisi Anda.

Mekanisme pertama: tarpits sebagai pengganti pemblokiran

Tarpit (tarpit, "lubang tar") adalah generator situs tak berujung. Crawler menerima halaman HTML yang valid dengan puluhan tautan, setiap tautan mengarah ke halaman yang sama yang dihasilkan, dan antrean penjelajahan tidak pernah kosong.

Alat terbuka yang paling terkenal adalah Nepenthes. Pengaturannya menunjukkan maksudnya dengan baik: secara default, server menahan respons dari 10 hingga 65 detik, memberikan teks "omong kosong markov", yang dihasilkan dari korpus, dan melakukan ini secara deterministik — URL yang sama selalu mengembalikan sampah yang sama, sehingga halaman terlihat seperti file statis biasa, bukan jebakan. Data diberikan dalam potongan kecil, "beberapa byte", untuk membakar timeout klien. Penulis memberikan pengukuran selama satu jam kerja: 1850 klien berbeda, 10.015 permintaan, dan 56.020 detik total penundaan — sekitar lima belas jam waktu mesin orang lain yang terbuang sia-sia.

Iocaine diatur berbeda: ia berfungsi sebagai proxy terbalik di depan situs nyata, pada penangkapan pertama memberikan bot tautan "diracuni" yang unik dan mengenalinya saat kembali, sementara teks dihasilkan dengan rantai Markov — harapan bahwa teks ini akan masuk ke dalam kumpulan pelatihan.

Di Cloudflare, teknik yang sama telah menjadi produk — AI Labyrinth, yang diperkenalkan pada Maret 2025. Halaman umpan tidak dihasilkan secara langsung: digunakan jalur pra-generasi di Workers AI, hasilnya disimpan di R2 dan disebarkan dengan cepat. Tautan ke labirin disisipkan ke dalam halaman biasa melalui transformasi HTML, dan di umpan itu sendiri terdapat meta-direktif untuk melawan pengindeksan, agar hasil pencarian tidak terpengaruh. Yang terpenting di sini adalah bukan waktu yang terbuang oleh bot, tetapi sinyal: tautan yang tersembunyi dari manusia dan ditandai dengan nofollow, hanya dilalui oleh otomatisasi, dan transisi tiga tingkat ke dalam labirin semacam itu menjadi jejak bot yang buruk. Skala masalah yang menjadi alasan ini dilakukan, Cloudflare memperkirakan lebih dari 50 miliar permintaan dari crawler AI per hari — sedikit kurang dari 1% dari total lalu lintas jaringan.

Bagaimana tarpits terlihat di log Anda

Pemandangan yang khas: antrean beberapa ribu URL, yang terus tumbuh, waktu respons stabil di sekitar satu setengah detik atau lebih, kode HTTP — semuanya 200, dan jumlah catatan yang diekstrak sama dengan nol. Tidak ada 403, tidak ada captcha, dan tidak ada jalan keluar: berapa pun halaman yang telah dijelajahi, tautan baru muncul lebih cepat daripada tautan lama ditutup.

Mekanisme kedua: konten beracun untuk agen AI

Jika mekanisme pertama membakar sumber daya, yang kedua memukul hasil. Peneliti Minghao Luo dan Liang Chen pada Juni 2026 menerbitkan karya dengan simulator FORGE (Fake Online Recommendations in Generative Environments): mereka menguji 12 model bahasa besar pada 225 produk dalam 15 kategori — dari pakaian hingga elektronik. Mekanisme serangan sederhana: dalam teks halaman, merek nyata diganti dengan merek fiktif.

Hasilnya — satu halaman palsu memberikan hingga 27% kasus ketika asisten merekomendasikan merek yang tidak ada, dan penggantian semua tiga hasil teratas meningkatkan proporsi ini hingga 73,8%. Model tidak hanya mengulangi nama palsu — mereka menciptakan keunggulan di bawahnya, termasuk klaim popularitas di komunitas. Tiga perlindungan yang diusulkan (prompt skeptisisme, konsensus berdasarkan pengetahuan internal model, verifikasi antar dokumen) baik tidak berhasil atau menciptakan masalah baru. Kesimpulan penulis: pemeriksaan harus dilakukan lebih awal di aliran — pada tahap pengumpulan, bukan pada tahap penalaran.

Mekanisme ketiga melengkapi gambaran. Dalam karya "A Whole New World: Creating a Parallel-Poisoned Web Only AI-Agents Can See" (Shaked Zychlinski) dijelaskan cloaking yang ditujukan khusus untuk agen AI: situs mengenali agen berdasarkan atribut browser, tanda tangan kerangka otomatisasi, dan karakteristik jaringan dan memberikan versi halaman yang berbeda — dengan instruksi tersembunyi dan fakta yang diubah. Manusia yang membuka URL yang sama melihat halaman normal, sehingga pemeriksaan manual "saya masuk, semuanya baik-baik saja" tidak membuktikan apa-apa.

Mengapa ini terutama masalah anggaran

Tarpit dirancang agar setiap halaman murah untuk situs dan mahal bagi Anda. Ketika lalu lintas dibayar per gigabyte, generator halaman tak berujung berubah menjadi penghitung pengeluaran Anda: Anda membayar untuk megabyte teks Markov yang tidak akan pernah menjadi baris dalam basis data. Persis aritmetika yang sama seperti dengan permintaan yang gagal — harga per gigabyte tidak memberi tahu tentang biaya hasil, sampai Anda menghitung biaya satu catatan yang berhasil, bukan permintaan.

Dari sini, aturan praktis pertama: batas lalu lintas harus ditetapkan pada tingkat domain dan tugas, bukan hanya pada tingkat akun. Domain yang menghabiskan lebih dari satu gigabyte dan tidak memberikan satu pun catatan harus dihentikan secara otomatis — tanpa ini, satu jebakan dapat menghabiskan anggaran harian dalam semalam.

Tujuh pemeriksaan yang menangkap sampah

  1. Hitung yield, bukan kode respons. Metrik utama dari jalur produksi adalah proporsi permintaan yang menghasilkan catatan valid dengan kolom wajib yang terisi. Selama Anda melihat proporsi 200-an, tarpits terlihat seperti sumber yang sehat.
  2. URL canary. Setiap N permintaan, mintalah alamat yang jelas tidak ada di dalam domain — dengan segmen jalur acak. Situs normal akan merespons 404 atau pengalihan, generator akan memberikan halaman lengkap dengan teks dan tautan. Ini adalah pemeriksaan yang paling murah dan paling andal.
  3. Kros-validasi dari profil IP yang berbeda. Ambil URL yang sama dengan dua rute berbeda — misalnya, melalui IP residensial dan melalui mobile — dan bandingkan hash kolom kunci: harga, nama, ketersediaan. Perbedaan pada URL yang sama dan waktu permintaan yang dekat berarti Anda melihat versi halaman yang berbeda, dan setidaknya satu dari mereka tidak ditujukan untuk manusia.
  4. Jangan ikuti tautan yang tidak terlihat. Tautan dengan nofollow, ukuran nol, display:none atau dikeluarkan dari layar — ini adalah umpan, dan mengikuti mereka adalah jejak bot itu sendiri. Saring mereka pada tahap ekstraksi tautan, bukan setelahnya.
  5. Aturan ketat pada respons. Batasi tidak hanya timeout, tetapi juga ukuran maksimum tubuh dan kedalaman maksimum penjelajahan dari titik masuk. Pengembalian lambat dalam potongan kecil adalah tanda khas dari lubang, bukan server lambat.
  6. Cari pola dalam teks. Generasi Markov menunjukkan dirinya melalui statistik: panjang paragraf yang mencurigakan rata, n-gram yang berulang antara halaman "berbeda", puluhan tautan keluar tanpa elemen struktural seperti harga, artikel, atau tanggal. Pemeriksaan sederhana pada shingle yang berulang antara halaman tetangga dari domain memisahkan sumber semacam itu dengan cepat.
  7. Periksa angka untuk akal sehat. Harga di luar koridor historis, produk tanpa satu pun kecocokan di basis merek Anda, lonjakan mendadak dalam variasi — ini adalah aturan validasi yang harus diterapkan sebelum pencatatan di basis data, bukan dalam laporan sebulan kemudian. Terutama jika data kemudian masuk ke dalam model atau keputusan otomatis tentang pembelian.

Apa yang harus dilakukan dengan kumpulan data yang sudah dikumpulkan

Jika kecurigaan muncul belakangan, urutkan bukan berdasarkan tanggal, tetapi berdasarkan sumber. Kelompokkan catatan berdasarkan domain dan lihat pada tiga ukuran: proporsi halaman tanpa kolom wajib, rata-rata jumlah tautan keluar di halaman, dan rentang panjang teks. Domain jebakan biasanya langsung terlihat pada ketiga ukuran tersebut. Kemudian, secara selektif periksa URL yang diperdebatkan dari profil IP yang berbeda — jika data tidak cocok, seluruh kumpulan dari domain tersebut perlu dibangun kembali, bukan diperbaiki dengan filter.

Secara terpisah, perlu untuk meninjau aturan untuk skenario agen, di mana model sendiri menjelajahi halaman dan membuat keputusan sendiri. Di sinilah penggantian satu halaman memberikan efek maksimum, dan tidak ada orang perantara yang akan memperhatikan keanehan dalam rantai. Asuransi minimum — meminta konfirmasi fakta dari dua sumber independen dan tidak membiarkan agen bertindak berdasarkan data yang diperoleh dari satu domain saja.

Singkatnya

Bot telah lama mengungguli manusia dalam proporsi lalu lintas, dan perlindungan tidak hanya merespons dengan filter: hari ini lebih murah untuk memberi otomatisasi sampah yang masuk akal daripada berdebat dengannya dengan pemblokiran. Ada tiga konsekuensi praktis. Hitung catatan yang berguna, bukan status respons. Pertahankan pemeriksaan canary dan batas lalu lintas untuk setiap domain. Bandingkan halaman yang diperdebatkan dari profil IP yang berbeda — perbedaan versi dari halaman yang sama adalah bukti bahwa Anda melihat internet yang terpisah, disiapkan khusus untuk bot. Proxy dalam skema ini hanya menyelesaikan satu tugas — memberikan pandangan kedua yang independen pada halaman; semua yang lainnya dilakukan oleh validasi di pihak Anda.