Bloga geri dön

Sizi yasaklamadılar — size çöplük yedirdiler: tuzaklar ve zehirli sayfalar 2026'da

HTTP 200 artık "veriler toplandı" anlamına gelmiyor. Nepenthes, Iocaine ve Cloudflare AI Labyrinth, tarayıcıları sonsuz üretilmiş metinle besliyor ve zehirli sayfalar, AI ajanlarının %27–73,8 oranında var olmayan markaları önermesine neden oluyor. Verilerin sessiz bir şekilde bozulmasının üç mekanizmasını ve veritabanına kayıttan önce çöpü yakalayan yedi kontrolü inceleyelim.

📅13 Eylül 2026
Sizi yasaklamadılar — size çöplük yedirdiler: tuzaklar ve zehirli sayfalar 2026'da

Parser çalışıyor. HTTP 200 sürekli akıyor, proxyler canlı, captcha çıkmıyor, bağlantı kuyruğu büyüyor. Ama bir hafta sonra toplanan fiyatların yarısının hayal olduğu ve gigabaytlarca trafiğin gerçek sitede olmayan sayfalara gittiği ortaya çıkıyor. Bu bir parser arızası değil ve kötü bir IP havuzu değil. Bu yeni bir koruma modu: site sizi engellemiyor, site sizi besliyor.

Bir buçuk yıl içinde anti-bot koruma endüstrisi sessizce amacını değiştirdi. Engelleme - pahalı ve göze çarpan bir önlem: scraper 403'ü görüyor, parmak izini düzeltiyor, alt ağı değiştiriyor ve geri dönüyor. Onun çalışmasını engellemekten çok, onun işini anlamsız hale getirmek çok daha kârlı. Aşağıda, milyonlarca sitede zaten çalışan üç mekanizma ve bunları sizin tarafınızda yakalayan kontrol seti var.

Birinci mekanizma: engelleme yerine tarpit

Tarpit (tarpit, "çamur çukuru") - sonsuz bir site üreten bir araçtır. Crawleer, her biri aynı şekilde üretilmiş bir sayfaya giden onlarca bağlantıyla geçerli bir HTML sayfası alır ve tarama kuyruğu asla boşalmaz.

En bilinen açık kaynaklı araç - Nepenthes. Ayarları, amacını iyi gösteriyor: varsayılan olarak sunucu 10 ile 65 saniye arasında bir yanıt tutuyor, "markov sohbeti" metni veriyor ve bunu belirli bir şekilde yapıyor - her zaman aynı URL aynı çöpü döndürüyor, böylece sayfalar sıradan statik dosyalar gibi görünür, bir tuzak gibi değil. Veriler küçük parçalar halinde, "birkaç bayt" olarak veriliyor, böylece istemci zaman aşımını aşındırıyor. Yazar, bir saatlik çalışma için ölçüm veriyor: 1850 farklı istemci, 10.015 istek ve toplam 56.020 saniye gecikme - yaklaşık on beş saat boşa harcanan makine zamanı.

Iocaine farklı çalışıyor: gerçek sitenin önünde ters proxy olarak çalışıyor, ilk yakalamada bota benzersiz bir "zehirli" bağlantı veriyor ve geri döndüğünde onu tanıyor, metni markov zincirleriyle üretiyor - bu metnin eğitim setine gireceği umuduyla.

Cloudflare'da aynı yöntem bir ürün haline geldi - AI Labyrinth, Mart 2025'te tanıtıldı. Tuzak sayfaları anında üretilmiyor: AI Workers üzerinde önceden üretim hattı kullanılıyor, sonuç R2'de saklanıyor ve hızlı bir şekilde dağıtılıyor. Labirent bağlantıları, HTML dönüşümü aracılığıyla normal sayfalara gömülüyor ve tuzak sayfalarında indekslemeye karşı meta direktifler var, böylece sonuç etkilenmiyor. Buradaki ana şey, botun harcanan zamanı değil, sinyal: insanlardan gizli ve nofollow ile işaretlenmiş bağlantılarda yalnızca otomatikler dolaşıyor ve böyle bir labirentte üç seviyeye kadar geçiş, kötü bir botun izlenimi haline geliyor. Cloudflare, bunun için yapılan sorunun ölçeğini günde 50 milyardan fazla AI crawler isteği - toplam ağ trafiğinin %1'inden biraz az olarak değerlendiriyor.

Tarpitin loglarınızda nasıl göründüğü

Karakteristik bir manzara: birkaç bin URL için bir kuyruk, sürekli büyüyor, yanıt süresi sürekli bir buçuk saniye civarında ve üzeri, HTTP kodları tamamen 200, ve çıkarılan geçerli kayıt sayısı sıfır. Ne 403, ne captcha ve ne de çıkış: kaç sayfa geçilmiş olursa olsun, yeni bağlantılar eski bağlantılardan daha hızlı ortaya çıkıyor.

İkinci mekanizma: AI ajanları için zehirli içerik

İlk mekanizma kaynakları yakarken, ikincisi sonuçlara darbe vuruyor. Araştırmacılar Minghao Luo ve Liang Chen, Haziran 2026'da FORGE (Generatif Ortamlarda Sahte Çevrimiçi Öneriler) simülatörü ile bir çalışma yayınladılar: 12 büyük dil modeli 15 kategoride 225 ürün üzerinde test edildi - giyimden elektroniğe kadar. Saldırı mekanizması basit: sayfanın metninde gerçek marka hayali bir marka ile değiştirilir.

Sonuç - bir sahte sayfa, asistanın var olmayan bir markayı önerdiği durumların %27'sine kadar çıkıyor ve üç üst sonuç değiştirildiğinde bu oran %73,8'e yükseliyor. Modeller sadece sahte ismi tekrarlamakla kalmadı - onun için avantajlar uydurdular, topluluklarda sözde popülariteyi de dahil ettiler. Üç önerilen koruma (şüphe için istem, modelin iç bilgileri üzerine konsensüs, belgeler arası kontrol) ya çalışmadı ya da yeni sorunlar yarattı. Yazarların sonucu: kontrol, akışın yukarısında - toplama aşamasında yapılmalıdır, düşünme aşamasında değil.

Üçüncü mekanizma tabloyu tamamlıyor. "A Whole New World: Creating a Parallel-Poisoned Web Only AI-Agents Can See" (Shaked Zychlinski) adlı çalışmada, tam olarak AI ajanlarına yönelik bir cloaking tanımlanıyor: site, ajanı tarayıcı özellikleri, otomasyon çerçevesinin imzaları ve ağ özellikleri ile tanır ve ona farklı bir sayfa versiyonu verir - gizli talimatlar ve değiştirilmiş gerçeklerle. Aynı URL'yi açan bir insan normal bir sayfa görür, bu nedenle "ben girdim, her şey yolunda" şeklindeki manuel kontrol hiçbir şey kanıtlamaz.

Neden bu öncelikle bir bütçe meselesi

Tarpit, her sayfanın site için ucuz ve sizin için pahalı olacak şekilde tasarlanmıştır. Trafik gigabayt başına ödendiğinde, sonsuz sayfa üreten bir makine, harcamalarınızın sayacına dönüşür: asla veritabanında bir satır haline gelmeyecek markov metni için megabaytlar ödüyorsunuz. Tam olarak başarısız isteklerle aynı aritmetik - gigabayt başına fiyat, sonuç maliyetini söylemez, ta ki bir başarılı kaydın maliyetini hesaplayana kadar.

Bundan dolayı ilk pratik kural: trafik limiti, yalnızca hesap düzeyinde değil, alan adı ve görev düzeyinde olmalıdır. Bir gigabayttan fazla tüketen ve hiçbir kayıt vermeyen bir alan adı otomatik olarak durdurulmalıdır - aksi takdirde bir tuzak, günlük bütçeyi bir gecede tüketebilir.

Atık yakalayan yedi kontrol

  1. Yanıt kodları yerine yield'i hesaplayın. Hattın ana metriği, geçerli bir kayıt veren isteklerin oranıdır. 200'lerin oranına bakarken, tarpit mükemmel bir sağlıklı kaynak gibi görünür.
  2. Kanarya URL'si. N isteğinde, alan içinde kesinlikle var olmayan bir adres isteyin - rastgele bir yol segmenti ile. Normal bir site 404 veya yönlendirme ile yanıt verir, jeneratör tam bir metin ve bağlantılarla dolu bir sayfa verir. Bu en ucuz ve en güvenilir kontroldür.
  3. Farklı bir IP profili ile çapraz doğrulama. Aynı URL'yi iki farklı yolla alın - örneğin, rezidans IP ve mobil üzerinden - ve anahtar alanların hash'lerini karşılaştırın: fiyatlar, isimler, mevcudiyet. Aynı URL ve benzer istek zamanı ile farklılık, size farklı sayfa versiyonları gösterildiği anlamına gelir ve en az bir tanesi insanlara yönelik değildir.
  4. Görünmez bağlantılara gitmeyin. nofollow ile işaretlenmiş, sıfır boyutlu, display:none olan veya ekranın dışına çıkarılmış bağlantılar - bunlar bir tuzaktır ve bunlara geçiş, botun izidir. Bunları bağlantı çıkarma aşamasında filtreleyin, sonrasında değil.
  5. Yanıt üzerinde sert tavanlar. Sadece zaman aşımını değil, aynı zamanda gövde maksimum boyutunu ve giriş noktasından maksimum derinliği sınırlayın. Küçük parçalar halinde yavaş yanıt verme, tipik bir çukur belirtisidir, yavaş bir sunucu değil.
  6. Metnin şablonluğunu arayın. Markov üretimi, istatistikle kendini ele verir: şüpheli derecede eşit paragraflar, "farklı" sayfalar arasında tekrar eden n-gramlar, fiyat, ürün kodu veya tarih gibi yapısal unsurların yokluğunda onlarca çıkış bağlantısı. Alanın komşu sayfaları arasında tekrar eden shingle'lar için basit bir kontrol, bu tür kaynakları bir grup halinde dışlar.
  7. Rakamları sağduyu ile kontrol edin. Tarihsel koridorun dışında bir fiyat, kendi marka veritabanınızda tek bir eşleşme olmayan bir ürün, aniden artan bir çeşitlilik - bunlar, veritabanına kayıttan önce geçerli olması gereken doğrulama kurallarıdır, bir ay sonra raporda değil. Özellikle veriler daha sonra bir modele veya otomatik bir satın alma kararına giriyorsa.

Artık toplanmış veri kümesi ile ne yapmalı

Şüphe sonradan ortaya çıkarsa, tarih yerine kaynaklara göre sıralayın. Kayıtları alan adına göre gruplandırın ve üç büyüklüğe bakın: zorunlu alanları olmayan sayfaların oranı, sayfadaki ortalama çıkış bağlantısı sayısı ve metin uzunluğunun dağılımı. Tuzak alan adları genellikle bu üç alanda hemen belirginleşir. Ardından, tartışmalı URL'leri farklı bir IP profili ile seçerek yeniden kontrol edin - veriler uyuşmuyorsa, bu alan adından tüm veri kümesi yeniden toplanmalıdır, filtreler ile onarılmamalıdır.

Ayrıca, modelin sayfalarda dolaştığı ve kendi kararlarını aldığı ajans senaryoları için kuralları gözden geçirmek önemlidir. İşte burada bir sayfanın değiştirilmesi maksimum etkiyi sağlar ve garipliği fark edecek bir ara insan yoktur. Minimum sigorta - iki bağımsız kaynaktan olayın doğrulanmasını talep etmek ve ajanın yalnızca tek bir alan adından elde edilen verilere dayanarak hareket etmesine izin vermemektir.

Kısa

Botlar çoktan insanları trafik payında geride bıraktı ve koruma sadece filtrelerle yanıt vermedi: bugün, bir otomata inandırıcı bir çöp beslemek, onu engellemelerle tartışmaktan daha ucuz. Üç pratik sonuç var. Geçerli kayıtları, yanıt durumlarını değil, sayın. Her alan için kanarya kontrollerini ve trafik limitlerini tutun. Tartışmalı sayfaları farklı IP profillerinden karşılaştırın - aynı sayfanın versiyonlarındaki farklılık, size yalnızca botlar için özel olarak hazırlanmış bir internet gösterildiğinin kanıtıdır. Bu şemada proxyler yalnızca sayfaya bağımsız bir ikinci bakış açısı sağlar; diğer her şeyi doğrulama sizin tarafınızdan yapılır.